LLM-continual-learning / trace /seq /order6 /trainer_state.json
YeMoKoo's picture
Add final checkpoint: trace_seq_order6
7552e50 verified
Raw
History Blame Contribute Delete
99.6 kB
{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 4.942675159235669,
"eval_steps": 500,
"global_step": 390,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.012738853503184714,
"grad_norm": 11.702886581420898,
"learning_rate": 0.0,
"loss": 2.5032,
"mean_token_accuracy": 0.6595549285411835,
"num_tokens": 5956.0,
"step": 1
},
{
"epoch": 0.025477707006369428,
"grad_norm": 12.431628227233887,
"learning_rate": 1.6666666666666667e-05,
"loss": 2.4454,
"mean_token_accuracy": 0.6762347519397736,
"num_tokens": 11573.0,
"step": 2
},
{
"epoch": 0.03821656050955414,
"grad_norm": 7.587985992431641,
"learning_rate": 3.3333333333333335e-05,
"loss": 2.2487,
"mean_token_accuracy": 0.6618549227714539,
"num_tokens": 17442.0,
"step": 3
},
{
"epoch": 0.050955414012738856,
"grad_norm": 4.835203647613525,
"learning_rate": 5e-05,
"loss": 1.8288,
"mean_token_accuracy": 0.6986225545406342,
"num_tokens": 23106.0,
"step": 4
},
{
"epoch": 0.06369426751592357,
"grad_norm": 3.932021141052246,
"learning_rate": 6.666666666666667e-05,
"loss": 1.5574,
"mean_token_accuracy": 0.7071255147457123,
"num_tokens": 29007.0,
"step": 5
},
{
"epoch": 0.07643312101910828,
"grad_norm": 1.9182102680206299,
"learning_rate": 8.333333333333334e-05,
"loss": 1.2577,
"mean_token_accuracy": 0.7433162331581116,
"num_tokens": 34759.0,
"step": 6
},
{
"epoch": 0.08917197452229299,
"grad_norm": 2.122396469116211,
"learning_rate": 0.0001,
"loss": 1.1196,
"mean_token_accuracy": 0.7598712146282196,
"num_tokens": 40489.0,
"step": 7
},
{
"epoch": 0.10191082802547771,
"grad_norm": 5.126816272735596,
"learning_rate": 0.00011666666666666668,
"loss": 1.3309,
"mean_token_accuracy": 0.7411045134067535,
"num_tokens": 46322.0,
"step": 8
},
{
"epoch": 0.11464968152866242,
"grad_norm": 4.019023895263672,
"learning_rate": 0.00013333333333333334,
"loss": 1.1162,
"mean_token_accuracy": 0.7461560070514679,
"num_tokens": 52247.0,
"step": 9
},
{
"epoch": 0.12738853503184713,
"grad_norm": 6.412837505340576,
"learning_rate": 0.00015000000000000001,
"loss": 1.1145,
"mean_token_accuracy": 0.7526903450489044,
"num_tokens": 58040.0,
"step": 10
},
{
"epoch": 0.14012738853503184,
"grad_norm": 1.8299505710601807,
"learning_rate": 0.0001666666666666667,
"loss": 0.9589,
"mean_token_accuracy": 0.7813899219036102,
"num_tokens": 63781.0,
"step": 11
},
{
"epoch": 0.15286624203821655,
"grad_norm": 0.8784621953964233,
"learning_rate": 0.00018333333333333334,
"loss": 0.9002,
"mean_token_accuracy": 0.7872510552406311,
"num_tokens": 69548.0,
"step": 12
},
{
"epoch": 0.16560509554140126,
"grad_norm": 0.6668952107429504,
"learning_rate": 0.0002,
"loss": 0.8018,
"mean_token_accuracy": 0.8026058673858643,
"num_tokens": 75372.0,
"step": 13
},
{
"epoch": 0.17834394904458598,
"grad_norm": 0.6606842875480652,
"learning_rate": 0.0001999965463076377,
"loss": 0.7878,
"mean_token_accuracy": 0.8076357841491699,
"num_tokens": 81188.0,
"step": 14
},
{
"epoch": 0.1910828025477707,
"grad_norm": 0.6952334642410278,
"learning_rate": 0.00019998618546911056,
"loss": 0.7102,
"mean_token_accuracy": 0.8217892348766327,
"num_tokens": 86949.0,
"step": 15
},
{
"epoch": 0.20382165605095542,
"grad_norm": 0.6817119121551514,
"learning_rate": 0.00019996891820008164,
"loss": 0.7056,
"mean_token_accuracy": 0.8268627524375916,
"num_tokens": 92943.0,
"step": 16
},
{
"epoch": 0.21656050955414013,
"grad_norm": 0.7418015003204346,
"learning_rate": 0.00019994474569326757,
"loss": 0.5142,
"mean_token_accuracy": 0.8664973080158234,
"num_tokens": 98677.0,
"step": 17
},
{
"epoch": 0.22929936305732485,
"grad_norm": 0.9997584819793701,
"learning_rate": 0.00019991366961835642,
"loss": 0.4582,
"mean_token_accuracy": 0.8754754364490509,
"num_tokens": 104531.0,
"step": 18
},
{
"epoch": 0.24203821656050956,
"grad_norm": 1.1314135789871216,
"learning_rate": 0.00019987569212189224,
"loss": 0.4308,
"mean_token_accuracy": 0.8855270445346832,
"num_tokens": 110386.0,
"step": 19
},
{
"epoch": 0.25477707006369427,
"grad_norm": 1.1828103065490723,
"learning_rate": 0.00019983081582712685,
"loss": 0.3452,
"mean_token_accuracy": 0.9081635177135468,
"num_tokens": 116076.0,
"step": 20
},
{
"epoch": 0.267515923566879,
"grad_norm": 0.9598802924156189,
"learning_rate": 0.0001997790438338385,
"loss": 0.311,
"mean_token_accuracy": 0.9159912765026093,
"num_tokens": 121789.0,
"step": 21
},
{
"epoch": 0.2802547770700637,
"grad_norm": 0.9245991110801697,
"learning_rate": 0.00019972037971811802,
"loss": 0.2722,
"mean_token_accuracy": 0.9285408556461334,
"num_tokens": 127688.0,
"step": 22
},
{
"epoch": 0.2929936305732484,
"grad_norm": 0.7882480025291443,
"learning_rate": 0.00019965482753212156,
"loss": 0.2672,
"mean_token_accuracy": 0.9340283870697021,
"num_tokens": 133375.0,
"step": 23
},
{
"epoch": 0.3057324840764331,
"grad_norm": 0.8053174614906311,
"learning_rate": 0.0001995823918037908,
"loss": 0.2154,
"mean_token_accuracy": 0.9449870884418488,
"num_tokens": 139058.0,
"step": 24
},
{
"epoch": 0.3184713375796178,
"grad_norm": 0.6255679726600647,
"learning_rate": 0.00019950307753654017,
"loss": 0.2028,
"mean_token_accuracy": 0.9470508992671967,
"num_tokens": 144993.0,
"step": 25
},
{
"epoch": 0.33121019108280253,
"grad_norm": 0.6230493783950806,
"learning_rate": 0.0001994168902089112,
"loss": 0.176,
"mean_token_accuracy": 0.9510246515274048,
"num_tokens": 150940.0,
"step": 26
},
{
"epoch": 0.34394904458598724,
"grad_norm": 0.5672556161880493,
"learning_rate": 0.00019932383577419432,
"loss": 0.1795,
"mean_token_accuracy": 0.949940025806427,
"num_tokens": 156815.0,
"step": 27
},
{
"epoch": 0.35668789808917195,
"grad_norm": 0.6387358903884888,
"learning_rate": 0.00019922392066001722,
"loss": 0.1889,
"mean_token_accuracy": 0.9488263130187988,
"num_tokens": 162604.0,
"step": 28
},
{
"epoch": 0.36942675159235666,
"grad_norm": 0.7072544097900391,
"learning_rate": 0.0001991171517679013,
"loss": 0.1841,
"mean_token_accuracy": 0.9489785730838776,
"num_tokens": 168207.0,
"step": 29
},
{
"epoch": 0.3821656050955414,
"grad_norm": 0.5900980830192566,
"learning_rate": 0.00019900353647278466,
"loss": 0.1691,
"mean_token_accuracy": 0.9533919394016266,
"num_tokens": 174104.0,
"step": 30
},
{
"epoch": 0.39490445859872614,
"grad_norm": 0.617685854434967,
"learning_rate": 0.00019888308262251285,
"loss": 0.1735,
"mean_token_accuracy": 0.9471724629402161,
"num_tokens": 179715.0,
"step": 31
},
{
"epoch": 0.40764331210191085,
"grad_norm": 0.4334038197994232,
"learning_rate": 0.00019875579853729676,
"loss": 0.1479,
"mean_token_accuracy": 0.9524288773536682,
"num_tokens": 185631.0,
"step": 32
},
{
"epoch": 0.42038216560509556,
"grad_norm": 0.515620768070221,
"learning_rate": 0.00019862169300913785,
"loss": 0.1518,
"mean_token_accuracy": 0.9586804509162903,
"num_tokens": 191482.0,
"step": 33
},
{
"epoch": 0.43312101910828027,
"grad_norm": 0.47444668412208557,
"learning_rate": 0.00019848077530122083,
"loss": 0.1477,
"mean_token_accuracy": 0.9550797045230865,
"num_tokens": 197391.0,
"step": 34
},
{
"epoch": 0.445859872611465,
"grad_norm": 0.39224231243133545,
"learning_rate": 0.00019833305514727395,
"loss": 0.1322,
"mean_token_accuracy": 0.9591817557811737,
"num_tokens": 203269.0,
"step": 35
},
{
"epoch": 0.4585987261146497,
"grad_norm": 0.3317239582538605,
"learning_rate": 0.0001981785427508966,
"loss": 0.1402,
"mean_token_accuracy": 0.9549793004989624,
"num_tokens": 209069.0,
"step": 36
},
{
"epoch": 0.4713375796178344,
"grad_norm": 0.3399812579154968,
"learning_rate": 0.00019801724878485438,
"loss": 0.1399,
"mean_token_accuracy": 0.9573641419410706,
"num_tokens": 214978.0,
"step": 37
},
{
"epoch": 0.4840764331210191,
"grad_norm": 0.39519068598747253,
"learning_rate": 0.00019784918439034216,
"loss": 0.1351,
"mean_token_accuracy": 0.9593660831451416,
"num_tokens": 220924.0,
"step": 38
},
{
"epoch": 0.4968152866242038,
"grad_norm": 0.4288669526576996,
"learning_rate": 0.00019767436117621413,
"loss": 0.1513,
"mean_token_accuracy": 0.9568993747234344,
"num_tokens": 226883.0,
"step": 39
},
{
"epoch": 0.5095541401273885,
"grad_norm": 0.31919434666633606,
"learning_rate": 0.00019749279121818235,
"loss": 0.1318,
"mean_token_accuracy": 0.9599088132381439,
"num_tokens": 232744.0,
"step": 40
},
{
"epoch": 0.5222929936305732,
"grad_norm": 0.38198190927505493,
"learning_rate": 0.00019730448705798239,
"loss": 0.1341,
"mean_token_accuracy": 0.9575787484645844,
"num_tokens": 238398.0,
"step": 41
},
{
"epoch": 0.535031847133758,
"grad_norm": 0.35228872299194336,
"learning_rate": 0.000197109461702507,
"loss": 0.1347,
"mean_token_accuracy": 0.958317756652832,
"num_tokens": 244014.0,
"step": 42
},
{
"epoch": 0.5477707006369427,
"grad_norm": 0.40999364852905273,
"learning_rate": 0.0001969077286229078,
"loss": 0.1388,
"mean_token_accuracy": 0.9575117230415344,
"num_tokens": 249892.0,
"step": 43
},
{
"epoch": 0.5605095541401274,
"grad_norm": 0.2757190465927124,
"learning_rate": 0.00019669930175366472,
"loss": 0.1166,
"mean_token_accuracy": 0.9629926383495331,
"num_tokens": 255604.0,
"step": 44
},
{
"epoch": 0.5732484076433121,
"grad_norm": 0.25512728095054626,
"learning_rate": 0.00019648419549162348,
"loss": 0.1145,
"mean_token_accuracy": 0.9622745513916016,
"num_tokens": 261418.0,
"step": 45
},
{
"epoch": 0.5859872611464968,
"grad_norm": 0.28370901942253113,
"learning_rate": 0.0001962624246950012,
"loss": 0.1164,
"mean_token_accuracy": 0.9658343195915222,
"num_tokens": 267305.0,
"step": 46
},
{
"epoch": 0.5987261146496815,
"grad_norm": 0.322531133890152,
"learning_rate": 0.00019603400468235998,
"loss": 0.1141,
"mean_token_accuracy": 0.9636189937591553,
"num_tokens": 273256.0,
"step": 47
},
{
"epoch": 0.6114649681528662,
"grad_norm": 0.3136317729949951,
"learning_rate": 0.0001957989512315489,
"loss": 0.1226,
"mean_token_accuracy": 0.9616194665431976,
"num_tokens": 279183.0,
"step": 48
},
{
"epoch": 0.6242038216560509,
"grad_norm": 0.2895571291446686,
"learning_rate": 0.0001955572805786141,
"loss": 0.1139,
"mean_token_accuracy": 0.964866429567337,
"num_tokens": 284996.0,
"step": 49
},
{
"epoch": 0.6369426751592356,
"grad_norm": 0.29423466324806213,
"learning_rate": 0.0001953090094166773,
"loss": 0.1133,
"mean_token_accuracy": 0.9634665548801422,
"num_tokens": 290748.0,
"step": 50
},
{
"epoch": 0.6496815286624203,
"grad_norm": 0.2770592272281647,
"learning_rate": 0.0001950541548947829,
"loss": 0.1131,
"mean_token_accuracy": 0.9628041386604309,
"num_tokens": 296619.0,
"step": 51
},
{
"epoch": 0.6624203821656051,
"grad_norm": 0.281352162361145,
"learning_rate": 0.0001947927346167132,
"loss": 0.1153,
"mean_token_accuracy": 0.9617563486099243,
"num_tokens": 302409.0,
"step": 52
},
{
"epoch": 0.6751592356687898,
"grad_norm": 0.29630422592163086,
"learning_rate": 0.00019452476663977248,
"loss": 0.1079,
"mean_token_accuracy": 0.9655645489692688,
"num_tokens": 308254.0,
"step": 53
},
{
"epoch": 0.6878980891719745,
"grad_norm": 0.2530810534954071,
"learning_rate": 0.00019425026947353992,
"loss": 0.1103,
"mean_token_accuracy": 0.9616009891033173,
"num_tokens": 314018.0,
"step": 54
},
{
"epoch": 0.7006369426751592,
"grad_norm": 0.1982153207063675,
"learning_rate": 0.00019396926207859084,
"loss": 0.105,
"mean_token_accuracy": 0.9627484083175659,
"num_tokens": 319961.0,
"step": 55
},
{
"epoch": 0.7133757961783439,
"grad_norm": 0.2126384824514389,
"learning_rate": 0.0001936817638651871,
"loss": 0.1025,
"mean_token_accuracy": 0.9655540585517883,
"num_tokens": 325625.0,
"step": 56
},
{
"epoch": 0.7261146496815286,
"grad_norm": 0.2395949512720108,
"learning_rate": 0.00019338779469193639,
"loss": 0.1021,
"mean_token_accuracy": 0.9675817787647247,
"num_tokens": 331617.0,
"step": 57
},
{
"epoch": 0.7388535031847133,
"grad_norm": 0.20850463211536407,
"learning_rate": 0.00019308737486442045,
"loss": 0.0955,
"mean_token_accuracy": 0.9671282768249512,
"num_tokens": 337583.0,
"step": 58
},
{
"epoch": 0.7515923566878981,
"grad_norm": 0.25087860226631165,
"learning_rate": 0.00019278052513379255,
"loss": 0.1065,
"mean_token_accuracy": 0.9648370742797852,
"num_tokens": 343277.0,
"step": 59
},
{
"epoch": 0.7643312101910829,
"grad_norm": 0.2028970867395401,
"learning_rate": 0.00019246726669534415,
"loss": 0.1025,
"mean_token_accuracy": 0.9668912291526794,
"num_tokens": 349050.0,
"step": 60
},
{
"epoch": 0.7770700636942676,
"grad_norm": 0.24881428480148315,
"learning_rate": 0.00019214762118704076,
"loss": 0.0985,
"mean_token_accuracy": 0.9658752381801605,
"num_tokens": 355012.0,
"step": 61
},
{
"epoch": 0.7898089171974523,
"grad_norm": 0.21099071204662323,
"learning_rate": 0.00019182161068802741,
"loss": 0.1012,
"mean_token_accuracy": 0.9665312170982361,
"num_tokens": 360813.0,
"step": 62
},
{
"epoch": 0.802547770700637,
"grad_norm": 0.19453655183315277,
"learning_rate": 0.00019148925771710347,
"loss": 0.1008,
"mean_token_accuracy": 0.9639951288700104,
"num_tokens": 366482.0,
"step": 63
},
{
"epoch": 0.8152866242038217,
"grad_norm": 0.2190839648246765,
"learning_rate": 0.00019115058523116733,
"loss": 0.096,
"mean_token_accuracy": 0.9681192338466644,
"num_tokens": 372478.0,
"step": 64
},
{
"epoch": 0.8280254777070064,
"grad_norm": 0.15556882321834564,
"learning_rate": 0.0001908056166236305,
"loss": 0.0982,
"mean_token_accuracy": 0.9662132263183594,
"num_tokens": 378248.0,
"step": 65
},
{
"epoch": 0.8407643312101911,
"grad_norm": 0.3257988691329956,
"learning_rate": 0.00019045437572280194,
"loss": 0.0947,
"mean_token_accuracy": 0.9682586193084717,
"num_tokens": 384141.0,
"step": 66
},
{
"epoch": 0.8535031847133758,
"grad_norm": 0.17047865688800812,
"learning_rate": 0.0001900968867902419,
"loss": 0.0992,
"mean_token_accuracy": 0.9660438597202301,
"num_tokens": 389956.0,
"step": 67
},
{
"epoch": 0.8662420382165605,
"grad_norm": 0.16795243322849274,
"learning_rate": 0.00018973317451908642,
"loss": 0.1015,
"mean_token_accuracy": 0.9670880436897278,
"num_tokens": 395734.0,
"step": 68
},
{
"epoch": 0.8789808917197452,
"grad_norm": 0.1481715440750122,
"learning_rate": 0.00018936326403234125,
"loss": 0.0956,
"mean_token_accuracy": 0.9670087695121765,
"num_tokens": 401472.0,
"step": 69
},
{
"epoch": 0.89171974522293,
"grad_norm": 0.13327202200889587,
"learning_rate": 0.0001889871808811469,
"loss": 0.0936,
"mean_token_accuracy": 0.9669307768344879,
"num_tokens": 407183.0,
"step": 70
},
{
"epoch": 0.9044585987261147,
"grad_norm": 0.24716301262378693,
"learning_rate": 0.00018860495104301345,
"loss": 0.0945,
"mean_token_accuracy": 0.9653833508491516,
"num_tokens": 412997.0,
"step": 71
},
{
"epoch": 0.9171974522292994,
"grad_norm": 0.22395415604114532,
"learning_rate": 0.00018821660092002641,
"loss": 0.0935,
"mean_token_accuracy": 0.9652094542980194,
"num_tokens": 419036.0,
"step": 72
},
{
"epoch": 0.9299363057324841,
"grad_norm": 0.15194346010684967,
"learning_rate": 0.00018782215733702286,
"loss": 0.0959,
"mean_token_accuracy": 0.9657859206199646,
"num_tokens": 424916.0,
"step": 73
},
{
"epoch": 0.9426751592356688,
"grad_norm": 0.19927610456943512,
"learning_rate": 0.00018742164753973855,
"loss": 0.0937,
"mean_token_accuracy": 0.9679467082023621,
"num_tokens": 430814.0,
"step": 74
},
{
"epoch": 0.9554140127388535,
"grad_norm": 0.15999707579612732,
"learning_rate": 0.00018701509919292613,
"loss": 0.0987,
"mean_token_accuracy": 0.9676094353199005,
"num_tokens": 436770.0,
"step": 75
},
{
"epoch": 0.9681528662420382,
"grad_norm": 0.18620580434799194,
"learning_rate": 0.00018660254037844388,
"loss": 0.0938,
"mean_token_accuracy": 0.9678452014923096,
"num_tokens": 442556.0,
"step": 76
},
{
"epoch": 0.9808917197452229,
"grad_norm": 0.16235262155532837,
"learning_rate": 0.0001861839995933164,
"loss": 0.0935,
"mean_token_accuracy": 0.9700812101364136,
"num_tokens": 448337.0,
"step": 77
},
{
"epoch": 0.9936305732484076,
"grad_norm": 0.2433900237083435,
"learning_rate": 0.00018575950574776595,
"loss": 0.092,
"mean_token_accuracy": 0.9680770635604858,
"num_tokens": 454194.0,
"step": 78
},
{
"epoch": 1.0,
"grad_norm": 0.2433900237083435,
"learning_rate": 0.00018532908816321558,
"loss": 0.0839,
"mean_token_accuracy": 0.9679836630821228,
"num_tokens": 457162.0,
"step": 79
},
{
"epoch": 1.0127388535031847,
"grad_norm": 0.21150463819503784,
"learning_rate": 0.00018489277657026375,
"loss": 0.0917,
"mean_token_accuracy": 0.9691027700901031,
"num_tokens": 463027.0,
"step": 80
},
{
"epoch": 1.0254777070063694,
"grad_norm": 0.15208442509174347,
"learning_rate": 0.0001844506011066308,
"loss": 0.0885,
"mean_token_accuracy": 0.9692970216274261,
"num_tokens": 468763.0,
"step": 81
},
{
"epoch": 1.0382165605095541,
"grad_norm": 0.14780759811401367,
"learning_rate": 0.00018400259231507717,
"loss": 0.0889,
"mean_token_accuracy": 0.9679381251335144,
"num_tokens": 474627.0,
"step": 82
},
{
"epoch": 1.0509554140127388,
"grad_norm": 0.212229385972023,
"learning_rate": 0.00018354878114129367,
"loss": 0.0926,
"mean_token_accuracy": 0.9674556255340576,
"num_tokens": 480345.0,
"step": 83
},
{
"epoch": 1.0636942675159236,
"grad_norm": 0.17746718227863312,
"learning_rate": 0.00018308919893176396,
"loss": 0.0888,
"mean_token_accuracy": 0.9679436087608337,
"num_tokens": 486219.0,
"step": 84
},
{
"epoch": 1.0764331210191083,
"grad_norm": 0.1740456521511078,
"learning_rate": 0.0001826238774315995,
"loss": 0.0925,
"mean_token_accuracy": 0.9673227965831757,
"num_tokens": 492167.0,
"step": 85
},
{
"epoch": 1.089171974522293,
"grad_norm": 0.26816144585609436,
"learning_rate": 0.00018215284878234642,
"loss": 0.0872,
"mean_token_accuracy": 0.9701121747493744,
"num_tokens": 498143.0,
"step": 86
},
{
"epoch": 1.1019108280254777,
"grad_norm": 0.11143972724676132,
"learning_rate": 0.00018167614551976567,
"loss": 0.0865,
"mean_token_accuracy": 0.9715863168239594,
"num_tokens": 504084.0,
"step": 87
},
{
"epoch": 1.1146496815286624,
"grad_norm": 0.2850157916545868,
"learning_rate": 0.00018119380057158568,
"loss": 0.0945,
"mean_token_accuracy": 0.968919575214386,
"num_tokens": 509909.0,
"step": 88
},
{
"epoch": 1.127388535031847,
"grad_norm": 0.2241591215133667,
"learning_rate": 0.00018070584725522762,
"loss": 0.0853,
"mean_token_accuracy": 0.9705215394496918,
"num_tokens": 515873.0,
"step": 89
},
{
"epoch": 1.1401273885350318,
"grad_norm": 0.118243508040905,
"learning_rate": 0.0001802123192755044,
"loss": 0.0886,
"mean_token_accuracy": 0.9700030982494354,
"num_tokens": 521831.0,
"step": 90
},
{
"epoch": 1.1528662420382165,
"grad_norm": 0.16607417166233063,
"learning_rate": 0.00017971325072229226,
"loss": 0.0925,
"mean_token_accuracy": 0.966924250125885,
"num_tokens": 527549.0,
"step": 91
},
{
"epoch": 1.1656050955414012,
"grad_norm": 0.12684203684329987,
"learning_rate": 0.00017920867606817625,
"loss": 0.0928,
"mean_token_accuracy": 0.9687173068523407,
"num_tokens": 533276.0,
"step": 92
},
{
"epoch": 1.178343949044586,
"grad_norm": 0.13812346756458282,
"learning_rate": 0.0001786986301660689,
"loss": 0.0846,
"mean_token_accuracy": 0.9694421291351318,
"num_tokens": 539329.0,
"step": 93
},
{
"epoch": 1.1910828025477707,
"grad_norm": 0.09481852501630783,
"learning_rate": 0.000178183148246803,
"loss": 0.0885,
"mean_token_accuracy": 0.9687439501285553,
"num_tokens": 545024.0,
"step": 94
},
{
"epoch": 1.2038216560509554,
"grad_norm": 0.10395218431949615,
"learning_rate": 0.00017766226591669785,
"loss": 0.0887,
"mean_token_accuracy": 0.9673281311988831,
"num_tokens": 550789.0,
"step": 95
},
{
"epoch": 1.21656050955414,
"grad_norm": 0.11677782982587814,
"learning_rate": 0.0001771360191551,
"loss": 0.0896,
"mean_token_accuracy": 0.9690899848937988,
"num_tokens": 556516.0,
"step": 96
},
{
"epoch": 1.2292993630573248,
"grad_norm": 0.15753789246082306,
"learning_rate": 0.0001766044443118978,
"loss": 0.0875,
"mean_token_accuracy": 0.9690685272216797,
"num_tokens": 562401.0,
"step": 97
},
{
"epoch": 1.2420382165605095,
"grad_norm": 0.10794474184513092,
"learning_rate": 0.00017606757810501088,
"loss": 0.0885,
"mean_token_accuracy": 0.966949075460434,
"num_tokens": 568179.0,
"step": 98
},
{
"epoch": 1.2547770700636942,
"grad_norm": 0.09485042840242386,
"learning_rate": 0.0001755254576178535,
"loss": 0.0892,
"mean_token_accuracy": 0.9696577191352844,
"num_tokens": 573875.0,
"step": 99
},
{
"epoch": 1.267515923566879,
"grad_norm": 0.11549390852451324,
"learning_rate": 0.00017497812029677344,
"loss": 0.088,
"mean_token_accuracy": 0.9707211554050446,
"num_tokens": 579570.0,
"step": 100
},
{
"epoch": 1.2802547770700636,
"grad_norm": 0.13922029733657837,
"learning_rate": 0.00017442560394846516,
"loss": 0.0871,
"mean_token_accuracy": 0.9688318371772766,
"num_tokens": 585316.0,
"step": 101
},
{
"epoch": 1.2929936305732483,
"grad_norm": 0.15525391697883606,
"learning_rate": 0.0001738679467373586,
"loss": 0.0852,
"mean_token_accuracy": 0.9691618084907532,
"num_tokens": 591315.0,
"step": 102
},
{
"epoch": 1.305732484076433,
"grad_norm": 0.10010520368814468,
"learning_rate": 0.00017330518718298264,
"loss": 0.0877,
"mean_token_accuracy": 0.9675675928592682,
"num_tokens": 597174.0,
"step": 103
},
{
"epoch": 1.3184713375796178,
"grad_norm": 0.11958754807710648,
"learning_rate": 0.00017273736415730488,
"loss": 0.0877,
"mean_token_accuracy": 0.9694679379463196,
"num_tokens": 602903.0,
"step": 104
},
{
"epoch": 1.3312101910828025,
"grad_norm": 0.1415647715330124,
"learning_rate": 0.0001721645168820462,
"loss": 0.0896,
"mean_token_accuracy": 0.9691061079502106,
"num_tokens": 608732.0,
"step": 105
},
{
"epoch": 1.3439490445859872,
"grad_norm": 0.10823409259319305,
"learning_rate": 0.00017158668492597186,
"loss": 0.0889,
"mean_token_accuracy": 0.9668814837932587,
"num_tokens": 614381.0,
"step": 106
},
{
"epoch": 1.356687898089172,
"grad_norm": 0.11169976741075516,
"learning_rate": 0.00017100390820215804,
"loss": 0.0826,
"mean_token_accuracy": 0.9673774540424347,
"num_tokens": 620269.0,
"step": 107
},
{
"epoch": 1.3694267515923566,
"grad_norm": 0.1433805376291275,
"learning_rate": 0.00017041622696523518,
"loss": 0.0879,
"mean_token_accuracy": 0.9695559442043304,
"num_tokens": 626049.0,
"step": 108
},
{
"epoch": 1.3821656050955413,
"grad_norm": 0.18322382867336273,
"learning_rate": 0.00016982368180860728,
"loss": 0.0859,
"mean_token_accuracy": 0.9673856794834137,
"num_tokens": 632069.0,
"step": 109
},
{
"epoch": 1.394904458598726,
"grad_norm": 0.12409456819295883,
"learning_rate": 0.00016922631366164797,
"loss": 0.0852,
"mean_token_accuracy": 0.9684251844882965,
"num_tokens": 637899.0,
"step": 110
},
{
"epoch": 1.4076433121019107,
"grad_norm": 0.09225030243396759,
"learning_rate": 0.0001686241637868734,
"loss": 0.0832,
"mean_token_accuracy": 0.9704109132289886,
"num_tokens": 643848.0,
"step": 111
},
{
"epoch": 1.4203821656050954,
"grad_norm": 0.1670381873846054,
"learning_rate": 0.00016801727377709194,
"loss": 0.0836,
"mean_token_accuracy": 0.9704890549182892,
"num_tokens": 649805.0,
"step": 112
},
{
"epoch": 1.4331210191082802,
"grad_norm": 0.09994162619113922,
"learning_rate": 0.00016740568555253155,
"loss": 0.0847,
"mean_token_accuracy": 0.9692024290561676,
"num_tokens": 655615.0,
"step": 113
},
{
"epoch": 1.4458598726114649,
"grad_norm": 0.16063818335533142,
"learning_rate": 0.00016678944135794374,
"loss": 0.0813,
"mean_token_accuracy": 0.9709331393241882,
"num_tokens": 661700.0,
"step": 114
},
{
"epoch": 1.4585987261146496,
"grad_norm": 0.08287379145622253,
"learning_rate": 0.00016616858375968595,
"loss": 0.082,
"mean_token_accuracy": 0.9694286584854126,
"num_tokens": 667652.0,
"step": 115
},
{
"epoch": 1.4713375796178343,
"grad_norm": 0.08043123781681061,
"learning_rate": 0.000165543155642781,
"loss": 0.0827,
"mean_token_accuracy": 0.9707711637020111,
"num_tokens": 673568.0,
"step": 116
},
{
"epoch": 1.484076433121019,
"grad_norm": 0.21236298978328705,
"learning_rate": 0.0001649132002079552,
"loss": 0.0893,
"mean_token_accuracy": 0.967911422252655,
"num_tokens": 679207.0,
"step": 117
},
{
"epoch": 1.4968152866242037,
"grad_norm": 0.08245056122541428,
"learning_rate": 0.00016427876096865394,
"loss": 0.0848,
"mean_token_accuracy": 0.9723709523677826,
"num_tokens": 685023.0,
"step": 118
},
{
"epoch": 1.5095541401273884,
"grad_norm": 0.09426119178533554,
"learning_rate": 0.00016363988174803638,
"loss": 0.0841,
"mean_token_accuracy": 0.9704490005970001,
"num_tokens": 690769.0,
"step": 119
},
{
"epoch": 1.5222929936305731,
"grad_norm": 0.18644003570079803,
"learning_rate": 0.00016299660667594814,
"loss": 0.0903,
"mean_token_accuracy": 0.9699574708938599,
"num_tokens": 696458.0,
"step": 120
},
{
"epoch": 1.5350318471337578,
"grad_norm": 0.08607800304889679,
"learning_rate": 0.00016234898018587337,
"loss": 0.0837,
"mean_token_accuracy": 0.9700290560722351,
"num_tokens": 702302.0,
"step": 121
},
{
"epoch": 1.5477707006369426,
"grad_norm": 0.09430722147226334,
"learning_rate": 0.00016169704701186527,
"loss": 0.085,
"mean_token_accuracy": 0.9681020677089691,
"num_tokens": 708041.0,
"step": 122
},
{
"epoch": 1.5605095541401273,
"grad_norm": 0.08460421860218048,
"learning_rate": 0.00016104085218545633,
"loss": 0.0853,
"mean_token_accuracy": 0.9702745676040649,
"num_tokens": 713717.0,
"step": 123
},
{
"epoch": 1.573248407643312,
"grad_norm": 0.15609629452228546,
"learning_rate": 0.00016038044103254775,
"loss": 0.0841,
"mean_token_accuracy": 0.9687030613422394,
"num_tokens": 719470.0,
"step": 124
},
{
"epoch": 1.5859872611464967,
"grad_norm": 0.09389069676399231,
"learning_rate": 0.00015971585917027862,
"loss": 0.0846,
"mean_token_accuracy": 0.9698879718780518,
"num_tokens": 725342.0,
"step": 125
},
{
"epoch": 1.5987261146496814,
"grad_norm": 0.09632205218076706,
"learning_rate": 0.00015904715250387498,
"loss": 0.0867,
"mean_token_accuracy": 0.9693426489830017,
"num_tokens": 730916.0,
"step": 126
},
{
"epoch": 1.611464968152866,
"grad_norm": 0.08171916007995605,
"learning_rate": 0.000158374367223479,
"loss": 0.0848,
"mean_token_accuracy": 0.9710951149463654,
"num_tokens": 736655.0,
"step": 127
},
{
"epoch": 1.6242038216560508,
"grad_norm": 0.08510521054267883,
"learning_rate": 0.0001576975498009583,
"loss": 0.0854,
"mean_token_accuracy": 0.9701623022556305,
"num_tokens": 742417.0,
"step": 128
},
{
"epoch": 1.6369426751592355,
"grad_norm": 0.13480724394321442,
"learning_rate": 0.0001570167469866962,
"loss": 0.0836,
"mean_token_accuracy": 0.9680794179439545,
"num_tokens": 748310.0,
"step": 129
},
{
"epoch": 1.6496815286624202,
"grad_norm": 0.08283688873052597,
"learning_rate": 0.0001563320058063622,
"loss": 0.0845,
"mean_token_accuracy": 0.9698716402053833,
"num_tokens": 753983.0,
"step": 130
},
{
"epoch": 1.662420382165605,
"grad_norm": 0.08392301946878433,
"learning_rate": 0.00015564337355766412,
"loss": 0.0875,
"mean_token_accuracy": 0.9689998030662537,
"num_tokens": 759724.0,
"step": 131
},
{
"epoch": 1.6751592356687897,
"grad_norm": 0.1573030650615692,
"learning_rate": 0.0001549508978070806,
"loss": 0.0867,
"mean_token_accuracy": 0.9682514369487762,
"num_tokens": 765331.0,
"step": 132
},
{
"epoch": 1.6878980891719744,
"grad_norm": 0.08259446918964386,
"learning_rate": 0.00015425462638657595,
"loss": 0.0819,
"mean_token_accuracy": 0.9699809551239014,
"num_tokens": 771258.0,
"step": 133
},
{
"epoch": 1.700636942675159,
"grad_norm": 0.07509376853704453,
"learning_rate": 0.00015355460739029586,
"loss": 0.0794,
"mean_token_accuracy": 0.9709121584892273,
"num_tokens": 777200.0,
"step": 134
},
{
"epoch": 1.7133757961783438,
"grad_norm": 0.08865094929933548,
"learning_rate": 0.00015285088917124556,
"loss": 0.082,
"mean_token_accuracy": 0.969213992357254,
"num_tokens": 783016.0,
"step": 135
},
{
"epoch": 1.7261146496815285,
"grad_norm": 0.07362065464258194,
"learning_rate": 0.0001521435203379498,
"loss": 0.0806,
"mean_token_accuracy": 0.9707930982112885,
"num_tokens": 788866.0,
"step": 136
},
{
"epoch": 1.7388535031847132,
"grad_norm": 0.07869767397642136,
"learning_rate": 0.00015143254975109538,
"loss": 0.0805,
"mean_token_accuracy": 0.9704539179801941,
"num_tokens": 794784.0,
"step": 137
},
{
"epoch": 1.7515923566878981,
"grad_norm": 0.08163165301084518,
"learning_rate": 0.0001507180265201559,
"loss": 0.083,
"mean_token_accuracy": 0.9703050553798676,
"num_tokens": 800539.0,
"step": 138
},
{
"epoch": 1.7643312101910829,
"grad_norm": 0.08681312203407288,
"learning_rate": 0.00015000000000000001,
"loss": 0.0818,
"mean_token_accuracy": 0.9712086617946625,
"num_tokens": 806576.0,
"step": 139
},
{
"epoch": 1.7770700636942676,
"grad_norm": 0.06929908692836761,
"learning_rate": 0.00014927851978748178,
"loss": 0.0836,
"mean_token_accuracy": 0.9684962332248688,
"num_tokens": 812258.0,
"step": 140
},
{
"epoch": 1.7898089171974523,
"grad_norm": 0.07867726683616638,
"learning_rate": 0.00014855363571801523,
"loss": 0.0823,
"mean_token_accuracy": 0.9689460396766663,
"num_tokens": 818185.0,
"step": 141
},
{
"epoch": 1.802547770700637,
"grad_norm": 0.07411834597587585,
"learning_rate": 0.00014782539786213183,
"loss": 0.0848,
"mean_token_accuracy": 0.970024436712265,
"num_tokens": 824020.0,
"step": 142
},
{
"epoch": 1.8152866242038217,
"grad_norm": 0.07753404974937439,
"learning_rate": 0.00014709385652202203,
"loss": 0.0806,
"mean_token_accuracy": 0.9706675112247467,
"num_tokens": 829948.0,
"step": 143
},
{
"epoch": 1.8280254777070064,
"grad_norm": 0.07096187025308609,
"learning_rate": 0.00014635906222806058,
"loss": 0.0805,
"mean_token_accuracy": 0.9710037112236023,
"num_tokens": 835875.0,
"step": 144
},
{
"epoch": 1.8407643312101911,
"grad_norm": 0.07591943442821503,
"learning_rate": 0.0001456210657353163,
"loss": 0.0809,
"mean_token_accuracy": 0.970432847738266,
"num_tokens": 841722.0,
"step": 145
},
{
"epoch": 1.8535031847133758,
"grad_norm": 0.07978185266256332,
"learning_rate": 0.00014487991802004623,
"loss": 0.0829,
"mean_token_accuracy": 0.9696160554885864,
"num_tokens": 847480.0,
"step": 146
},
{
"epoch": 1.8662420382165605,
"grad_norm": 0.07600882649421692,
"learning_rate": 0.0001441356702761744,
"loss": 0.0852,
"mean_token_accuracy": 0.9686452448368073,
"num_tokens": 853223.0,
"step": 147
},
{
"epoch": 1.8789808917197452,
"grad_norm": 0.08528134226799011,
"learning_rate": 0.00014338837391175582,
"loss": 0.0821,
"mean_token_accuracy": 0.969150722026825,
"num_tokens": 859154.0,
"step": 148
},
{
"epoch": 1.89171974522293,
"grad_norm": 0.07796002924442291,
"learning_rate": 0.0001426380805454254,
"loss": 0.0839,
"mean_token_accuracy": 0.9670197069644928,
"num_tokens": 864888.0,
"step": 149
},
{
"epoch": 1.9044585987261147,
"grad_norm": 0.06374917924404144,
"learning_rate": 0.0001418848420028325,
"loss": 0.081,
"mean_token_accuracy": 0.9701065123081207,
"num_tokens": 870644.0,
"step": 150
},
{
"epoch": 1.9171974522292994,
"grad_norm": 0.06862544268369675,
"learning_rate": 0.00014112871031306119,
"loss": 0.0838,
"mean_token_accuracy": 0.9695531725883484,
"num_tokens": 876363.0,
"step": 151
},
{
"epoch": 1.929936305732484,
"grad_norm": 0.07496917247772217,
"learning_rate": 0.00014036973770503624,
"loss": 0.0865,
"mean_token_accuracy": 0.9700089395046234,
"num_tokens": 882064.0,
"step": 152
},
{
"epoch": 1.9426751592356688,
"grad_norm": 0.07615385949611664,
"learning_rate": 0.0001396079766039157,
"loss": 0.0805,
"mean_token_accuracy": 0.9710656702518463,
"num_tokens": 888176.0,
"step": 153
},
{
"epoch": 1.9554140127388535,
"grad_norm": 0.07192222774028778,
"learning_rate": 0.00013884347962746948,
"loss": 0.083,
"mean_token_accuracy": 0.9697221219539642,
"num_tokens": 893889.0,
"step": 154
},
{
"epoch": 1.9681528662420382,
"grad_norm": 0.07578443735837936,
"learning_rate": 0.00013807629958244498,
"loss": 0.084,
"mean_token_accuracy": 0.9704568088054657,
"num_tokens": 899571.0,
"step": 155
},
{
"epoch": 1.980891719745223,
"grad_norm": 0.07004435360431671,
"learning_rate": 0.0001373064894609194,
"loss": 0.079,
"mean_token_accuracy": 0.9704504013061523,
"num_tokens": 905660.0,
"step": 156
},
{
"epoch": 1.9936305732484076,
"grad_norm": 0.07362619787454605,
"learning_rate": 0.00013653410243663952,
"loss": 0.0824,
"mean_token_accuracy": 0.9680611491203308,
"num_tokens": 911391.0,
"step": 157
},
{
"epoch": 2.0,
"grad_norm": 0.11275428533554077,
"learning_rate": 0.0001357591918613486,
"loss": 0.0804,
"mean_token_accuracy": 0.9699540734291077,
"num_tokens": 914252.0,
"step": 158
},
{
"epoch": 2.0127388535031847,
"grad_norm": 0.06643939763307571,
"learning_rate": 0.0001349818112611015,
"loss": 0.082,
"mean_token_accuracy": 0.9684470295906067,
"num_tokens": 919957.0,
"step": 159
},
{
"epoch": 2.0254777070063694,
"grad_norm": 0.06806526333093643,
"learning_rate": 0.00013420201433256689,
"loss": 0.0805,
"mean_token_accuracy": 0.9701605141162872,
"num_tokens": 925795.0,
"step": 160
},
{
"epoch": 2.038216560509554,
"grad_norm": 0.07850659638643265,
"learning_rate": 0.00013341985493931877,
"loss": 0.0819,
"mean_token_accuracy": 0.9690955281257629,
"num_tokens": 931652.0,
"step": 161
},
{
"epoch": 2.050955414012739,
"grad_norm": 0.08378799259662628,
"learning_rate": 0.0001326353871081156,
"loss": 0.0832,
"mean_token_accuracy": 0.9697659015655518,
"num_tokens": 937440.0,
"step": 162
},
{
"epoch": 2.0636942675159236,
"grad_norm": 0.07717715948820114,
"learning_rate": 0.00013184866502516845,
"loss": 0.0809,
"mean_token_accuracy": 0.9703347980976105,
"num_tokens": 943405.0,
"step": 163
},
{
"epoch": 2.0764331210191083,
"grad_norm": 0.07521849125623703,
"learning_rate": 0.00013105974303239838,
"loss": 0.0807,
"mean_token_accuracy": 0.9717486500740051,
"num_tokens": 949323.0,
"step": 164
},
{
"epoch": 2.089171974522293,
"grad_norm": 0.07702027261257172,
"learning_rate": 0.0001302686756236826,
"loss": 0.0795,
"mean_token_accuracy": 0.9727192223072052,
"num_tokens": 955257.0,
"step": 165
},
{
"epoch": 2.1019108280254777,
"grad_norm": 0.08259471505880356,
"learning_rate": 0.00012947551744109043,
"loss": 0.0849,
"mean_token_accuracy": 0.9688011109828949,
"num_tokens": 960995.0,
"step": 166
},
{
"epoch": 2.1146496815286624,
"grad_norm": 0.0739479586482048,
"learning_rate": 0.00012868032327110904,
"loss": 0.0824,
"mean_token_accuracy": 0.969892680644989,
"num_tokens": 966672.0,
"step": 167
},
{
"epoch": 2.127388535031847,
"grad_norm": 0.07641750574111938,
"learning_rate": 0.00012788314804085903,
"loss": 0.0858,
"mean_token_accuracy": 0.9697946012020111,
"num_tokens": 972364.0,
"step": 168
},
{
"epoch": 2.140127388535032,
"grad_norm": 0.0725414827466011,
"learning_rate": 0.00012708404681430053,
"loss": 0.0817,
"mean_token_accuracy": 0.9705974459648132,
"num_tokens": 978178.0,
"step": 169
},
{
"epoch": 2.1528662420382165,
"grad_norm": 0.07151193916797638,
"learning_rate": 0.00012628307478842953,
"loss": 0.0797,
"mean_token_accuracy": 0.9706787467002869,
"num_tokens": 984046.0,
"step": 170
},
{
"epoch": 2.1656050955414012,
"grad_norm": 0.07521957904100418,
"learning_rate": 0.0001254802872894655,
"loss": 0.0825,
"mean_token_accuracy": 0.9709869623184204,
"num_tokens": 989761.0,
"step": 171
},
{
"epoch": 2.178343949044586,
"grad_norm": 0.060880064964294434,
"learning_rate": 0.00012467573976902935,
"loss": 0.0815,
"mean_token_accuracy": 0.9719542562961578,
"num_tokens": 995492.0,
"step": 172
},
{
"epoch": 2.1910828025477707,
"grad_norm": 0.06429281830787659,
"learning_rate": 0.0001238694878003138,
"loss": 0.0807,
"mean_token_accuracy": 0.9716426134109497,
"num_tokens": 1001409.0,
"step": 173
},
{
"epoch": 2.2038216560509554,
"grad_norm": 0.06350357830524445,
"learning_rate": 0.00012306158707424403,
"loss": 0.0809,
"mean_token_accuracy": 0.9708206653594971,
"num_tokens": 1007230.0,
"step": 174
},
{
"epoch": 2.21656050955414,
"grad_norm": 0.07249215990304947,
"learning_rate": 0.00012225209339563145,
"loss": 0.0827,
"mean_token_accuracy": 0.9682056307792664,
"num_tokens": 1012954.0,
"step": 175
},
{
"epoch": 2.229299363057325,
"grad_norm": 0.0626291036605835,
"learning_rate": 0.00012144106267931876,
"loss": 0.0815,
"mean_token_accuracy": 0.970901608467102,
"num_tokens": 1018688.0,
"step": 176
},
{
"epoch": 2.2420382165605095,
"grad_norm": 0.0756702721118927,
"learning_rate": 0.00012062855094631778,
"loss": 0.0835,
"mean_token_accuracy": 0.9696753025054932,
"num_tokens": 1024426.0,
"step": 177
},
{
"epoch": 2.254777070063694,
"grad_norm": 0.07612688839435577,
"learning_rate": 0.00011981461431993977,
"loss": 0.0844,
"mean_token_accuracy": 0.9688003659248352,
"num_tokens": 1030166.0,
"step": 178
},
{
"epoch": 2.267515923566879,
"grad_norm": 0.06982312351465225,
"learning_rate": 0.00011899930902191902,
"loss": 0.0825,
"mean_token_accuracy": 0.9691322147846222,
"num_tokens": 1035931.0,
"step": 179
},
{
"epoch": 2.2802547770700636,
"grad_norm": 0.06827575713396072,
"learning_rate": 0.00011818269136852909,
"loss": 0.0813,
"mean_token_accuracy": 0.968558132648468,
"num_tokens": 1041751.0,
"step": 180
},
{
"epoch": 2.2929936305732483,
"grad_norm": 0.0701732337474823,
"learning_rate": 0.00011736481776669306,
"loss": 0.08,
"mean_token_accuracy": 0.9714179337024689,
"num_tokens": 1047622.0,
"step": 181
},
{
"epoch": 2.305732484076433,
"grad_norm": 0.06068166717886925,
"learning_rate": 0.00011654574471008713,
"loss": 0.081,
"mean_token_accuracy": 0.9697660803794861,
"num_tokens": 1053476.0,
"step": 182
},
{
"epoch": 2.3184713375796178,
"grad_norm": 0.06006036698818207,
"learning_rate": 0.00011572552877523854,
"loss": 0.0775,
"mean_token_accuracy": 0.9702647030353546,
"num_tokens": 1059492.0,
"step": 183
},
{
"epoch": 2.3312101910828025,
"grad_norm": 0.08254722505807877,
"learning_rate": 0.00011490422661761744,
"loss": 0.0827,
"mean_token_accuracy": 0.9685249626636505,
"num_tokens": 1065309.0,
"step": 184
},
{
"epoch": 2.343949044585987,
"grad_norm": 0.06635136902332306,
"learning_rate": 0.00011408189496772368,
"loss": 0.0812,
"mean_token_accuracy": 0.9697334468364716,
"num_tokens": 1071198.0,
"step": 185
},
{
"epoch": 2.356687898089172,
"grad_norm": 0.06728167831897736,
"learning_rate": 0.00011325859062716795,
"loss": 0.0814,
"mean_token_accuracy": 0.9717288315296173,
"num_tokens": 1077067.0,
"step": 186
},
{
"epoch": 2.3694267515923566,
"grad_norm": 0.07463246583938599,
"learning_rate": 0.00011243437046474853,
"loss": 0.0784,
"mean_token_accuracy": 0.9716354310512543,
"num_tokens": 1083052.0,
"step": 187
},
{
"epoch": 2.3821656050955413,
"grad_norm": 0.08216842263936996,
"learning_rate": 0.00011160929141252303,
"loss": 0.0837,
"mean_token_accuracy": 0.9671932756900787,
"num_tokens": 1088937.0,
"step": 188
},
{
"epoch": 2.394904458598726,
"grad_norm": 0.06495602428913116,
"learning_rate": 0.00011078341046187589,
"loss": 0.0814,
"mean_token_accuracy": 0.9711815714836121,
"num_tokens": 1094653.0,
"step": 189
},
{
"epoch": 2.4076433121019107,
"grad_norm": 0.07960506528615952,
"learning_rate": 0.00010995678465958168,
"loss": 0.0835,
"mean_token_accuracy": 0.969552218914032,
"num_tokens": 1100430.0,
"step": 190
},
{
"epoch": 2.4203821656050954,
"grad_norm": 0.062362972646951675,
"learning_rate": 0.00010912947110386484,
"loss": 0.0795,
"mean_token_accuracy": 0.9699338972568512,
"num_tokens": 1106256.0,
"step": 191
},
{
"epoch": 2.43312101910828,
"grad_norm": 0.0681372880935669,
"learning_rate": 0.00010830152694045552,
"loss": 0.079,
"mean_token_accuracy": 0.9708313941955566,
"num_tokens": 1112215.0,
"step": 192
},
{
"epoch": 2.445859872611465,
"grad_norm": 0.06679756194353104,
"learning_rate": 0.00010747300935864243,
"loss": 0.0819,
"mean_token_accuracy": 0.9696420729160309,
"num_tokens": 1118009.0,
"step": 193
},
{
"epoch": 2.4585987261146496,
"grad_norm": 0.07661960273981094,
"learning_rate": 0.00010664397558732244,
"loss": 0.0822,
"mean_token_accuracy": 0.9715335965156555,
"num_tokens": 1123730.0,
"step": 194
},
{
"epoch": 2.4713375796178343,
"grad_norm": 0.0642203763127327,
"learning_rate": 0.00010581448289104758,
"loss": 0.0827,
"mean_token_accuracy": 0.968016117811203,
"num_tokens": 1129518.0,
"step": 195
},
{
"epoch": 2.484076433121019,
"grad_norm": 0.07240530848503113,
"learning_rate": 0.00010498458856606972,
"loss": 0.0796,
"mean_token_accuracy": 0.9701722860336304,
"num_tokens": 1135449.0,
"step": 196
},
{
"epoch": 2.4968152866242037,
"grad_norm": 0.06760862469673157,
"learning_rate": 0.00010415434993638269,
"loss": 0.0821,
"mean_token_accuracy": 0.9692021906375885,
"num_tokens": 1141197.0,
"step": 197
},
{
"epoch": 2.5095541401273884,
"grad_norm": 0.06540956348180771,
"learning_rate": 0.00010332382434976266,
"loss": 0.0817,
"mean_token_accuracy": 0.9689615964889526,
"num_tokens": 1147124.0,
"step": 198
},
{
"epoch": 2.522292993630573,
"grad_norm": 0.07420117408037186,
"learning_rate": 0.0001024930691738073,
"loss": 0.0839,
"mean_token_accuracy": 0.9682944118976593,
"num_tokens": 1152771.0,
"step": 199
},
{
"epoch": 2.535031847133758,
"grad_norm": 0.061245448887348175,
"learning_rate": 0.00010166214179197264,
"loss": 0.0809,
"mean_token_accuracy": 0.9693343043327332,
"num_tokens": 1158609.0,
"step": 200
},
{
"epoch": 2.5477707006369426,
"grad_norm": 0.07398168742656708,
"learning_rate": 0.00010083109959960973,
"loss": 0.0836,
"mean_token_accuracy": 0.9690487086772919,
"num_tokens": 1164359.0,
"step": 201
},
{
"epoch": 2.5605095541401273,
"grad_norm": 0.06130973622202873,
"learning_rate": 0.0001,
"loss": 0.0825,
"mean_token_accuracy": 0.9688800871372223,
"num_tokens": 1170050.0,
"step": 202
},
{
"epoch": 2.573248407643312,
"grad_norm": 0.059589143842458725,
"learning_rate": 9.916890040039031e-05,
"loss": 0.0822,
"mean_token_accuracy": 0.9665999114513397,
"num_tokens": 1175743.0,
"step": 203
},
{
"epoch": 2.5859872611464967,
"grad_norm": 0.06661482155323029,
"learning_rate": 9.833785820802739e-05,
"loss": 0.0799,
"mean_token_accuracy": 0.9697706997394562,
"num_tokens": 1181691.0,
"step": 204
},
{
"epoch": 2.5987261146496814,
"grad_norm": 0.05537959188222885,
"learning_rate": 9.750693082619273e-05,
"loss": 0.0805,
"mean_token_accuracy": 0.9696797430515289,
"num_tokens": 1187528.0,
"step": 205
},
{
"epoch": 2.611464968152866,
"grad_norm": 0.06162695959210396,
"learning_rate": 9.667617565023735e-05,
"loss": 0.0792,
"mean_token_accuracy": 0.9706624746322632,
"num_tokens": 1193495.0,
"step": 206
},
{
"epoch": 2.624203821656051,
"grad_norm": 0.06732062250375748,
"learning_rate": 9.584565006361734e-05,
"loss": 0.0799,
"mean_token_accuracy": 0.9701182544231415,
"num_tokens": 1199382.0,
"step": 207
},
{
"epoch": 2.6369426751592355,
"grad_norm": 0.05625153332948685,
"learning_rate": 9.501541143393028e-05,
"loss": 0.0785,
"mean_token_accuracy": 0.9705232977867126,
"num_tokens": 1205213.0,
"step": 208
},
{
"epoch": 2.6496815286624202,
"grad_norm": 0.07023126631975174,
"learning_rate": 9.418551710895243e-05,
"loss": 0.0793,
"mean_token_accuracy": 0.9707081913948059,
"num_tokens": 1211149.0,
"step": 209
},
{
"epoch": 2.662420382165605,
"grad_norm": 0.06514835357666016,
"learning_rate": 9.335602441267759e-05,
"loss": 0.0805,
"mean_token_accuracy": 0.9710925817489624,
"num_tokens": 1216886.0,
"step": 210
},
{
"epoch": 2.6751592356687897,
"grad_norm": 0.059471771121025085,
"learning_rate": 9.252699064135758e-05,
"loss": 0.0797,
"mean_token_accuracy": 0.9702471494674683,
"num_tokens": 1222701.0,
"step": 211
},
{
"epoch": 2.6878980891719744,
"grad_norm": 0.06286533921957016,
"learning_rate": 9.169847305954447e-05,
"loss": 0.0785,
"mean_token_accuracy": 0.9719226360321045,
"num_tokens": 1228689.0,
"step": 212
},
{
"epoch": 2.700636942675159,
"grad_norm": 0.06742485612630844,
"learning_rate": 9.087052889613518e-05,
"loss": 0.0781,
"mean_token_accuracy": 0.9720667004585266,
"num_tokens": 1234695.0,
"step": 213
},
{
"epoch": 2.713375796178344,
"grad_norm": 0.06361982226371765,
"learning_rate": 9.004321534041835e-05,
"loss": 0.0831,
"mean_token_accuracy": 0.9710087776184082,
"num_tokens": 1240312.0,
"step": 214
},
{
"epoch": 2.7261146496815285,
"grad_norm": 0.05879661440849304,
"learning_rate": 8.921658953812415e-05,
"loss": 0.0804,
"mean_token_accuracy": 0.9697242081165314,
"num_tokens": 1246211.0,
"step": 215
},
{
"epoch": 2.738853503184713,
"grad_norm": 0.0721222385764122,
"learning_rate": 8.839070858747697e-05,
"loss": 0.0828,
"mean_token_accuracy": 0.9670188128948212,
"num_tokens": 1251858.0,
"step": 216
},
{
"epoch": 2.7515923566878984,
"grad_norm": 0.06966773420572281,
"learning_rate": 8.756562953525152e-05,
"loss": 0.081,
"mean_token_accuracy": 0.9688356220722198,
"num_tokens": 1257762.0,
"step": 217
},
{
"epoch": 2.7643312101910826,
"grad_norm": 0.07037881761789322,
"learning_rate": 8.674140937283208e-05,
"loss": 0.0803,
"mean_token_accuracy": 0.9705818891525269,
"num_tokens": 1263595.0,
"step": 218
},
{
"epoch": 2.777070063694268,
"grad_norm": 0.06910485774278641,
"learning_rate": 8.591810503227635e-05,
"loss": 0.0818,
"mean_token_accuracy": 0.9677394926548004,
"num_tokens": 1269366.0,
"step": 219
},
{
"epoch": 2.789808917197452,
"grad_norm": 0.06575801223516464,
"learning_rate": 8.509577338238255e-05,
"loss": 0.081,
"mean_token_accuracy": 0.9707579016685486,
"num_tokens": 1275141.0,
"step": 220
},
{
"epoch": 2.802547770700637,
"grad_norm": 0.06782017648220062,
"learning_rate": 8.427447122476148e-05,
"loss": 0.079,
"mean_token_accuracy": 0.9716315567493439,
"num_tokens": 1281059.0,
"step": 221
},
{
"epoch": 2.8152866242038215,
"grad_norm": 0.06269742548465729,
"learning_rate": 8.345425528991288e-05,
"loss": 0.0791,
"mean_token_accuracy": 0.9703017473220825,
"num_tokens": 1286948.0,
"step": 222
},
{
"epoch": 2.8280254777070066,
"grad_norm": 0.06444042176008224,
"learning_rate": 8.263518223330697e-05,
"loss": 0.0808,
"mean_token_accuracy": 0.9698095917701721,
"num_tokens": 1292712.0,
"step": 223
},
{
"epoch": 2.840764331210191,
"grad_norm": 0.09271910041570663,
"learning_rate": 8.181730863147093e-05,
"loss": 0.0816,
"mean_token_accuracy": 0.9655384719371796,
"num_tokens": 1298468.0,
"step": 224
},
{
"epoch": 2.853503184713376,
"grad_norm": 0.060135409235954285,
"learning_rate": 8.100069097808103e-05,
"loss": 0.0778,
"mean_token_accuracy": 0.9718931913375854,
"num_tokens": 1304438.0,
"step": 225
},
{
"epoch": 2.8662420382165603,
"grad_norm": 0.06524819135665894,
"learning_rate": 8.018538568006027e-05,
"loss": 0.0807,
"mean_token_accuracy": 0.9684958159923553,
"num_tokens": 1310182.0,
"step": 226
},
{
"epoch": 2.8789808917197455,
"grad_norm": 0.06421119719743729,
"learning_rate": 7.937144905368226e-05,
"loss": 0.0786,
"mean_token_accuracy": 0.9699224829673767,
"num_tokens": 1316131.0,
"step": 227
},
{
"epoch": 2.8917197452229297,
"grad_norm": 0.060645345598459244,
"learning_rate": 7.855893732068125e-05,
"loss": 0.0784,
"mean_token_accuracy": 0.969642162322998,
"num_tokens": 1322027.0,
"step": 228
},
{
"epoch": 2.904458598726115,
"grad_norm": 0.0872688964009285,
"learning_rate": 7.774790660436858e-05,
"loss": 0.0823,
"mean_token_accuracy": 0.968631237745285,
"num_tokens": 1327798.0,
"step": 229
},
{
"epoch": 2.917197452229299,
"grad_norm": 0.06461073458194733,
"learning_rate": 7.693841292575598e-05,
"loss": 0.0826,
"mean_token_accuracy": 0.9698716104030609,
"num_tokens": 1333471.0,
"step": 230
},
{
"epoch": 2.9299363057324843,
"grad_norm": 0.056773390620946884,
"learning_rate": 7.613051219968623e-05,
"loss": 0.0768,
"mean_token_accuracy": 0.9718391001224518,
"num_tokens": 1339505.0,
"step": 231
},
{
"epoch": 2.9426751592356686,
"grad_norm": 0.06603224575519562,
"learning_rate": 7.532426023097063e-05,
"loss": 0.0815,
"mean_token_accuracy": 0.9700065553188324,
"num_tokens": 1345269.0,
"step": 232
},
{
"epoch": 2.9554140127388537,
"grad_norm": 0.0672716423869133,
"learning_rate": 7.451971271053455e-05,
"loss": 0.0812,
"mean_token_accuracy": 0.9715771377086639,
"num_tokens": 1351110.0,
"step": 233
},
{
"epoch": 2.968152866242038,
"grad_norm": 0.07741643488407135,
"learning_rate": 7.371692521157048e-05,
"loss": 0.0831,
"mean_token_accuracy": 0.9681077897548676,
"num_tokens": 1356754.0,
"step": 234
},
{
"epoch": 2.980891719745223,
"grad_norm": 0.06615743786096573,
"learning_rate": 7.291595318569951e-05,
"loss": 0.08,
"mean_token_accuracy": 0.9720337688922882,
"num_tokens": 1362541.0,
"step": 235
},
{
"epoch": 2.9936305732484074,
"grad_norm": 0.0631820484995842,
"learning_rate": 7.211685195914097e-05,
"loss": 0.0794,
"mean_token_accuracy": 0.969734251499176,
"num_tokens": 1368478.0,
"step": 236
},
{
"epoch": 3.0,
"grad_norm": 0.0631820484995842,
"learning_rate": 7.131967672889101e-05,
"loss": 0.0829,
"mean_token_accuracy": 0.9699602127075195,
"num_tokens": 1371273.0,
"step": 237
},
{
"epoch": 3.0127388535031847,
"grad_norm": 0.12515003979206085,
"learning_rate": 7.052448255890957e-05,
"loss": 0.0809,
"mean_token_accuracy": 0.9699683785438538,
"num_tokens": 1376910.0,
"step": 238
},
{
"epoch": 3.0254777070063694,
"grad_norm": 0.06320805847644806,
"learning_rate": 6.973132437631742e-05,
"loss": 0.0831,
"mean_token_accuracy": 0.9673981666564941,
"num_tokens": 1382588.0,
"step": 239
},
{
"epoch": 3.038216560509554,
"grad_norm": 0.06302487105131149,
"learning_rate": 6.894025696760163e-05,
"loss": 0.0781,
"mean_token_accuracy": 0.971070796251297,
"num_tokens": 1388544.0,
"step": 240
},
{
"epoch": 3.050955414012739,
"grad_norm": 0.06294956803321838,
"learning_rate": 6.815133497483157e-05,
"loss": 0.0759,
"mean_token_accuracy": 0.9699667692184448,
"num_tokens": 1394637.0,
"step": 241
},
{
"epoch": 3.0636942675159236,
"grad_norm": 0.06007220596075058,
"learning_rate": 6.736461289188445e-05,
"loss": 0.0774,
"mean_token_accuracy": 0.9709272682666779,
"num_tokens": 1400617.0,
"step": 242
},
{
"epoch": 3.0764331210191083,
"grad_norm": 0.0644717738032341,
"learning_rate": 6.658014506068126e-05,
"loss": 0.0781,
"mean_token_accuracy": 0.9710936546325684,
"num_tokens": 1406526.0,
"step": 243
},
{
"epoch": 3.089171974522293,
"grad_norm": 0.060126665979623795,
"learning_rate": 6.579798566743314e-05,
"loss": 0.0811,
"mean_token_accuracy": 0.9704807698726654,
"num_tokens": 1412184.0,
"step": 244
},
{
"epoch": 3.1019108280254777,
"grad_norm": 0.05887053534388542,
"learning_rate": 6.501818873889855e-05,
"loss": 0.0774,
"mean_token_accuracy": 0.9728036522865295,
"num_tokens": 1418128.0,
"step": 245
},
{
"epoch": 3.1146496815286624,
"grad_norm": 0.05612581968307495,
"learning_rate": 6.424080813865138e-05,
"loss": 0.0814,
"mean_token_accuracy": 0.9696513116359711,
"num_tokens": 1423829.0,
"step": 246
},
{
"epoch": 3.127388535031847,
"grad_norm": 0.06269162148237228,
"learning_rate": 6.34658975633605e-05,
"loss": 0.0813,
"mean_token_accuracy": 0.9693237543106079,
"num_tokens": 1429471.0,
"step": 247
},
{
"epoch": 3.140127388535032,
"grad_norm": 0.06179108843207359,
"learning_rate": 6.269351053908061e-05,
"loss": 0.0819,
"mean_token_accuracy": 0.9713320434093475,
"num_tokens": 1435123.0,
"step": 248
},
{
"epoch": 3.1528662420382165,
"grad_norm": 0.05953584611415863,
"learning_rate": 6.192370041755505e-05,
"loss": 0.0785,
"mean_token_accuracy": 0.9720431268215179,
"num_tokens": 1441017.0,
"step": 249
},
{
"epoch": 3.1656050955414012,
"grad_norm": 0.05920351296663284,
"learning_rate": 6.115652037253053e-05,
"loss": 0.0815,
"mean_token_accuracy": 0.9707915484905243,
"num_tokens": 1446861.0,
"step": 250
},
{
"epoch": 3.178343949044586,
"grad_norm": 0.06840499490499496,
"learning_rate": 6.039202339608432e-05,
"loss": 0.0808,
"mean_token_accuracy": 0.9717750549316406,
"num_tokens": 1452670.0,
"step": 251
},
{
"epoch": 3.1910828025477707,
"grad_norm": 0.05971769243478775,
"learning_rate": 5.963026229496378e-05,
"loss": 0.0802,
"mean_token_accuracy": 0.9706140756607056,
"num_tokens": 1458452.0,
"step": 252
},
{
"epoch": 3.2038216560509554,
"grad_norm": 0.06719432771205902,
"learning_rate": 5.887128968693887e-05,
"loss": 0.0781,
"mean_token_accuracy": 0.9705943167209625,
"num_tokens": 1464333.0,
"step": 253
},
{
"epoch": 3.21656050955414,
"grad_norm": 0.06789746135473251,
"learning_rate": 5.8115157997167536e-05,
"loss": 0.0798,
"mean_token_accuracy": 0.9682629108428955,
"num_tokens": 1470164.0,
"step": 254
},
{
"epoch": 3.229299363057325,
"grad_norm": 0.0646275132894516,
"learning_rate": 5.736191945457463e-05,
"loss": 0.0777,
"mean_token_accuracy": 0.9719286262989044,
"num_tokens": 1476106.0,
"step": 255
},
{
"epoch": 3.2420382165605095,
"grad_norm": 0.06187563017010689,
"learning_rate": 5.6611626088244194e-05,
"loss": 0.0794,
"mean_token_accuracy": 0.9710664451122284,
"num_tokens": 1481980.0,
"step": 256
},
{
"epoch": 3.254777070063694,
"grad_norm": 0.06890401989221573,
"learning_rate": 5.58643297238256e-05,
"loss": 0.0808,
"mean_token_accuracy": 0.9685621857643127,
"num_tokens": 1487801.0,
"step": 257
},
{
"epoch": 3.267515923566879,
"grad_norm": 0.06694001704454422,
"learning_rate": 5.5120081979953785e-05,
"loss": 0.0809,
"mean_token_accuracy": 0.9690047204494476,
"num_tokens": 1493525.0,
"step": 258
},
{
"epoch": 3.2802547770700636,
"grad_norm": 0.0607277937233448,
"learning_rate": 5.43789342646837e-05,
"loss": 0.0788,
"mean_token_accuracy": 0.9698476493358612,
"num_tokens": 1499454.0,
"step": 259
},
{
"epoch": 3.2929936305732483,
"grad_norm": 0.06306935101747513,
"learning_rate": 5.3640937771939436e-05,
"loss": 0.0784,
"mean_token_accuracy": 0.9711892902851105,
"num_tokens": 1505312.0,
"step": 260
},
{
"epoch": 3.305732484076433,
"grad_norm": 0.07524839788675308,
"learning_rate": 5.290614347797802e-05,
"loss": 0.0817,
"mean_token_accuracy": 0.969828873872757,
"num_tokens": 1511011.0,
"step": 261
},
{
"epoch": 3.3184713375796178,
"grad_norm": 0.06218244507908821,
"learning_rate": 5.217460213786821e-05,
"loss": 0.0786,
"mean_token_accuracy": 0.971624881029129,
"num_tokens": 1516884.0,
"step": 262
},
{
"epoch": 3.3312101910828025,
"grad_norm": 0.07467464357614517,
"learning_rate": 5.1446364281984774e-05,
"loss": 0.0795,
"mean_token_accuracy": 0.969776451587677,
"num_tokens": 1522673.0,
"step": 263
},
{
"epoch": 3.343949044585987,
"grad_norm": 0.05752575770020485,
"learning_rate": 5.072148021251821e-05,
"loss": 0.0778,
"mean_token_accuracy": 0.9715888500213623,
"num_tokens": 1528694.0,
"step": 264
},
{
"epoch": 3.356687898089172,
"grad_norm": 0.0617908351123333,
"learning_rate": 5.000000000000002e-05,
"loss": 0.0816,
"mean_token_accuracy": 0.9708900451660156,
"num_tokens": 1534358.0,
"step": 265
},
{
"epoch": 3.3694267515923566,
"grad_norm": 0.05914432927966118,
"learning_rate": 4.92819734798441e-05,
"loss": 0.0773,
"mean_token_accuracy": 0.9710153937339783,
"num_tokens": 1540287.0,
"step": 266
},
{
"epoch": 3.3821656050955413,
"grad_norm": 0.05921492725610733,
"learning_rate": 4.856745024890466e-05,
"loss": 0.0815,
"mean_token_accuracy": 0.9695830941200256,
"num_tokens": 1545974.0,
"step": 267
},
{
"epoch": 3.394904458598726,
"grad_norm": 0.06628979742527008,
"learning_rate": 4.78564796620502e-05,
"loss": 0.0802,
"mean_token_accuracy": 0.9675322771072388,
"num_tokens": 1551832.0,
"step": 268
},
{
"epoch": 3.4076433121019107,
"grad_norm": 0.07890256494283676,
"learning_rate": 4.7149110828754464e-05,
"loss": 0.0808,
"mean_token_accuracy": 0.9691312909126282,
"num_tokens": 1557500.0,
"step": 269
},
{
"epoch": 3.4203821656050954,
"grad_norm": 0.06330595165491104,
"learning_rate": 4.644539260970416e-05,
"loss": 0.0804,
"mean_token_accuracy": 0.9696717262268066,
"num_tokens": 1563298.0,
"step": 270
},
{
"epoch": 3.43312101910828,
"grad_norm": 0.06580579280853271,
"learning_rate": 4.574537361342407e-05,
"loss": 0.0813,
"mean_token_accuracy": 0.967890202999115,
"num_tokens": 1568999.0,
"step": 271
},
{
"epoch": 3.445859872611465,
"grad_norm": 0.06915119290351868,
"learning_rate": 4.50491021929194e-05,
"loss": 0.0778,
"mean_token_accuracy": 0.9705429673194885,
"num_tokens": 1574940.0,
"step": 272
},
{
"epoch": 3.4585987261146496,
"grad_norm": 0.07045170664787292,
"learning_rate": 4.435662644233594e-05,
"loss": 0.0811,
"mean_token_accuracy": 0.9662905633449554,
"num_tokens": 1580639.0,
"step": 273
},
{
"epoch": 3.4713375796178343,
"grad_norm": 0.062564916908741,
"learning_rate": 4.3667994193637796e-05,
"loss": 0.0801,
"mean_token_accuracy": 0.9690904021263123,
"num_tokens": 1586429.0,
"step": 274
},
{
"epoch": 3.484076433121019,
"grad_norm": 0.06395804136991501,
"learning_rate": 4.298325301330383e-05,
"loss": 0.0794,
"mean_token_accuracy": 0.9688712358474731,
"num_tokens": 1592273.0,
"step": 275
},
{
"epoch": 3.4968152866242037,
"grad_norm": 0.062301404774188995,
"learning_rate": 4.23024501990417e-05,
"loss": 0.0815,
"mean_token_accuracy": 0.9681532680988312,
"num_tokens": 1597957.0,
"step": 276
},
{
"epoch": 3.5095541401273884,
"grad_norm": 0.0626181960105896,
"learning_rate": 4.1625632776521037e-05,
"loss": 0.0798,
"mean_token_accuracy": 0.9706997573375702,
"num_tokens": 1603724.0,
"step": 277
},
{
"epoch": 3.522292993630573,
"grad_norm": 0.05692123994231224,
"learning_rate": 4.095284749612503e-05,
"loss": 0.0794,
"mean_token_accuracy": 0.9695738852024078,
"num_tokens": 1609505.0,
"step": 278
},
{
"epoch": 3.535031847133758,
"grad_norm": 0.06804097443819046,
"learning_rate": 4.028414082972141e-05,
"loss": 0.0829,
"mean_token_accuracy": 0.9673117399215698,
"num_tokens": 1615076.0,
"step": 279
},
{
"epoch": 3.5477707006369426,
"grad_norm": 0.058650195598602295,
"learning_rate": 3.961955896745224e-05,
"loss": 0.0759,
"mean_token_accuracy": 0.9718073904514313,
"num_tokens": 1621133.0,
"step": 280
},
{
"epoch": 3.5605095541401273,
"grad_norm": 0.05979275703430176,
"learning_rate": 3.89591478145437e-05,
"loss": 0.0816,
"mean_token_accuracy": 0.9686501324176788,
"num_tokens": 1626813.0,
"step": 281
},
{
"epoch": 3.573248407643312,
"grad_norm": 0.06317468732595444,
"learning_rate": 3.8302952988134756e-05,
"loss": 0.0797,
"mean_token_accuracy": 0.9697080850601196,
"num_tokens": 1632590.0,
"step": 282
},
{
"epoch": 3.5859872611464967,
"grad_norm": 0.0720604881644249,
"learning_rate": 3.7651019814126654e-05,
"loss": 0.0818,
"mean_token_accuracy": 0.9681734144687653,
"num_tokens": 1638215.0,
"step": 283
},
{
"epoch": 3.5987261146496814,
"grad_norm": 0.06027304753661156,
"learning_rate": 3.7003393324051874e-05,
"loss": 0.0785,
"mean_token_accuracy": 0.9694899618625641,
"num_tokens": 1644145.0,
"step": 284
},
{
"epoch": 3.611464968152866,
"grad_norm": 0.06597089767456055,
"learning_rate": 3.6360118251963645e-05,
"loss": 0.0785,
"mean_token_accuracy": 0.9711305201053619,
"num_tokens": 1649962.0,
"step": 285
},
{
"epoch": 3.624203821656051,
"grad_norm": 0.05844837427139282,
"learning_rate": 3.5721239031346066e-05,
"loss": 0.0783,
"mean_token_accuracy": 0.9709188640117645,
"num_tokens": 1655803.0,
"step": 286
},
{
"epoch": 3.6369426751592355,
"grad_norm": 0.0590052530169487,
"learning_rate": 3.508679979204481e-05,
"loss": 0.0801,
"mean_token_accuracy": 0.9683609306812286,
"num_tokens": 1661598.0,
"step": 287
},
{
"epoch": 3.6496815286624202,
"grad_norm": 0.061401642858982086,
"learning_rate": 3.445684435721897e-05,
"loss": 0.076,
"mean_token_accuracy": 0.9688279926776886,
"num_tokens": 1667597.0,
"step": 288
},
{
"epoch": 3.662420382165605,
"grad_norm": 0.06329475343227386,
"learning_rate": 3.383141624031408e-05,
"loss": 0.0779,
"mean_token_accuracy": 0.9683489799499512,
"num_tokens": 1673442.0,
"step": 289
},
{
"epoch": 3.6751592356687897,
"grad_norm": 0.059181585907936096,
"learning_rate": 3.3210558642056275e-05,
"loss": 0.0788,
"mean_token_accuracy": 0.9712333083152771,
"num_tokens": 1679281.0,
"step": 290
},
{
"epoch": 3.6878980891719744,
"grad_norm": 0.06536949425935745,
"learning_rate": 3.259431444746846e-05,
"loss": 0.0765,
"mean_token_accuracy": 0.9710779190063477,
"num_tokens": 1685323.0,
"step": 291
},
{
"epoch": 3.700636942675159,
"grad_norm": 0.06547825783491135,
"learning_rate": 3.198272622290804e-05,
"loss": 0.079,
"mean_token_accuracy": 0.9710780680179596,
"num_tokens": 1691092.0,
"step": 292
},
{
"epoch": 3.713375796178344,
"grad_norm": 0.05739077925682068,
"learning_rate": 3.137583621312665e-05,
"loss": 0.0801,
"mean_token_accuracy": 0.9698264896869659,
"num_tokens": 1696792.0,
"step": 293
},
{
"epoch": 3.7261146496815285,
"grad_norm": 0.06391553580760956,
"learning_rate": 3.077368633835205e-05,
"loss": 0.0786,
"mean_token_accuracy": 0.9698535203933716,
"num_tokens": 1702628.0,
"step": 294
},
{
"epoch": 3.738853503184713,
"grad_norm": 0.06288064271211624,
"learning_rate": 3.0176318191392726e-05,
"loss": 0.0797,
"mean_token_accuracy": 0.9702651500701904,
"num_tokens": 1708370.0,
"step": 295
},
{
"epoch": 3.7515923566878984,
"grad_norm": 0.06188668683171272,
"learning_rate": 2.9583773034764826e-05,
"loss": 0.0808,
"mean_token_accuracy": 0.9695869386196136,
"num_tokens": 1714054.0,
"step": 296
},
{
"epoch": 3.7643312101910826,
"grad_norm": 0.06291300803422928,
"learning_rate": 2.8996091797841973e-05,
"loss": 0.0781,
"mean_token_accuracy": 0.9701660573482513,
"num_tokens": 1719950.0,
"step": 297
},
{
"epoch": 3.777070063694268,
"grad_norm": 0.06500188261270523,
"learning_rate": 2.8413315074028158e-05,
"loss": 0.0805,
"mean_token_accuracy": 0.9698123633861542,
"num_tokens": 1725681.0,
"step": 298
},
{
"epoch": 3.789808917197452,
"grad_norm": 0.05530101805925369,
"learning_rate": 2.7835483117953788e-05,
"loss": 0.0753,
"mean_token_accuracy": 0.9717605412006378,
"num_tokens": 1731743.0,
"step": 299
},
{
"epoch": 3.802547770700637,
"grad_norm": 0.05843547359108925,
"learning_rate": 2.7262635842695127e-05,
"loss": 0.0809,
"mean_token_accuracy": 0.9675658047199249,
"num_tokens": 1737417.0,
"step": 300
},
{
"epoch": 3.8152866242038215,
"grad_norm": 0.06355355679988861,
"learning_rate": 2.669481281701739e-05,
"loss": 0.0786,
"mean_token_accuracy": 0.9698892831802368,
"num_tokens": 1743259.0,
"step": 301
},
{
"epoch": 3.8280254777070066,
"grad_norm": 0.06356390565633774,
"learning_rate": 2.6132053262641466e-05,
"loss": 0.0777,
"mean_token_accuracy": 0.9720463454723358,
"num_tokens": 1749189.0,
"step": 302
},
{
"epoch": 3.840764331210191,
"grad_norm": 0.05667181685566902,
"learning_rate": 2.5574396051534832e-05,
"loss": 0.0783,
"mean_token_accuracy": 0.9687053561210632,
"num_tokens": 1755036.0,
"step": 303
},
{
"epoch": 3.853503184713376,
"grad_norm": 0.05982512980699539,
"learning_rate": 2.502187970322657e-05,
"loss": 0.0795,
"mean_token_accuracy": 0.9688549339771271,
"num_tokens": 1760783.0,
"step": 304
},
{
"epoch": 3.8662420382165603,
"grad_norm": 0.06933721899986267,
"learning_rate": 2.4474542382146537e-05,
"loss": 0.0776,
"mean_token_accuracy": 0.9714393317699432,
"num_tokens": 1766726.0,
"step": 305
},
{
"epoch": 3.8789808917197455,
"grad_norm": 0.05933714285492897,
"learning_rate": 2.3932421894989167e-05,
"loss": 0.0805,
"mean_token_accuracy": 0.9698410928249359,
"num_tokens": 1772461.0,
"step": 306
},
{
"epoch": 3.8917197452229297,
"grad_norm": 0.0652802586555481,
"learning_rate": 2.339555568810221e-05,
"loss": 0.0778,
"mean_token_accuracy": 0.9679871499538422,
"num_tokens": 1778366.0,
"step": 307
},
{
"epoch": 3.904458598726115,
"grad_norm": 0.056804459542036057,
"learning_rate": 2.2863980844900036e-05,
"loss": 0.0769,
"mean_token_accuracy": 0.9695643186569214,
"num_tokens": 1784312.0,
"step": 308
},
{
"epoch": 3.917197452229299,
"grad_norm": 0.06611023098230362,
"learning_rate": 2.2337734083302164e-05,
"loss": 0.0778,
"mean_token_accuracy": 0.9698533117771149,
"num_tokens": 1790222.0,
"step": 309
},
{
"epoch": 3.9299363057324843,
"grad_norm": 0.06188473105430603,
"learning_rate": 2.181685175319702e-05,
"loss": 0.0774,
"mean_token_accuracy": 0.9717121124267578,
"num_tokens": 1796119.0,
"step": 310
},
{
"epoch": 3.9426751592356686,
"grad_norm": 0.07523812353610992,
"learning_rate": 2.1301369833931117e-05,
"loss": 0.0782,
"mean_token_accuracy": 0.9710706174373627,
"num_tokens": 1801956.0,
"step": 311
},
{
"epoch": 3.9554140127388537,
"grad_norm": 0.06925839930772781,
"learning_rate": 2.079132393182378e-05,
"loss": 0.0775,
"mean_token_accuracy": 0.9701486229896545,
"num_tokens": 1807849.0,
"step": 312
},
{
"epoch": 3.968152866242038,
"grad_norm": 0.060205671936273575,
"learning_rate": 2.0286749277707782e-05,
"loss": 0.0793,
"mean_token_accuracy": 0.9711746573448181,
"num_tokens": 1813665.0,
"step": 313
},
{
"epoch": 3.980891719745223,
"grad_norm": 0.05551603436470032,
"learning_rate": 1.9787680724495617e-05,
"loss": 0.0781,
"mean_token_accuracy": 0.9699892699718475,
"num_tokens": 1819526.0,
"step": 314
},
{
"epoch": 3.9936305732484074,
"grad_norm": 0.05668932944536209,
"learning_rate": 1.929415274477239e-05,
"loss": 0.0776,
"mean_token_accuracy": 0.9723762273788452,
"num_tokens": 1825422.0,
"step": 315
},
{
"epoch": 4.0,
"grad_norm": 0.10560295730829239,
"learning_rate": 1.880619942841435e-05,
"loss": 0.0813,
"mean_token_accuracy": 0.9703971147537231,
"num_tokens": 1828224.0,
"step": 316
},
{
"epoch": 4.012738853503185,
"grad_norm": 0.05985555797815323,
"learning_rate": 1.832385448023435e-05,
"loss": 0.075,
"mean_token_accuracy": 0.9709382057189941,
"num_tokens": 1834274.0,
"step": 317
},
{
"epoch": 4.025477707006369,
"grad_norm": 0.06078803911805153,
"learning_rate": 1.7847151217653624e-05,
"loss": 0.079,
"mean_token_accuracy": 0.9702737033367157,
"num_tokens": 1840021.0,
"step": 318
},
{
"epoch": 4.038216560509555,
"grad_norm": 0.05563405156135559,
"learning_rate": 1.7376122568400532e-05,
"loss": 0.0799,
"mean_token_accuracy": 0.967924565076828,
"num_tokens": 1845728.0,
"step": 319
},
{
"epoch": 4.050955414012739,
"grad_norm": 0.05961964279413223,
"learning_rate": 1.6910801068236016e-05,
"loss": 0.0757,
"mean_token_accuracy": 0.9721821546554565,
"num_tokens": 1851756.0,
"step": 320
},
{
"epoch": 4.063694267515924,
"grad_norm": 0.05875060334801674,
"learning_rate": 1.6451218858706374e-05,
"loss": 0.0786,
"mean_token_accuracy": 0.9688915312290192,
"num_tokens": 1857580.0,
"step": 321
},
{
"epoch": 4.076433121019108,
"grad_norm": 0.05704512819647789,
"learning_rate": 1.5997407684922862e-05,
"loss": 0.0773,
"mean_token_accuracy": 0.9704049527645111,
"num_tokens": 1863490.0,
"step": 322
},
{
"epoch": 4.089171974522293,
"grad_norm": 0.05825570225715637,
"learning_rate": 1.5549398893369216e-05,
"loss": 0.0791,
"mean_token_accuracy": 0.9705154597759247,
"num_tokens": 1869218.0,
"step": 323
},
{
"epoch": 4.101910828025478,
"grad_norm": 0.06335911154747009,
"learning_rate": 1.5107223429736272e-05,
"loss": 0.0764,
"mean_token_accuracy": 0.9686422348022461,
"num_tokens": 1875203.0,
"step": 324
},
{
"epoch": 4.114649681528663,
"grad_norm": 0.059776898473501205,
"learning_rate": 1.467091183678444e-05,
"loss": 0.078,
"mean_token_accuracy": 0.9711997509002686,
"num_tokens": 1881030.0,
"step": 325
},
{
"epoch": 4.127388535031847,
"grad_norm": 0.06166277453303337,
"learning_rate": 1.4240494252234049e-05,
"loss": 0.0761,
"mean_token_accuracy": 0.971430629491806,
"num_tokens": 1887018.0,
"step": 326
},
{
"epoch": 4.140127388535032,
"grad_norm": 0.05846632644534111,
"learning_rate": 1.3816000406683604e-05,
"loss": 0.0758,
"mean_token_accuracy": 0.9700314998626709,
"num_tokens": 1893015.0,
"step": 327
},
{
"epoch": 4.1528662420382165,
"grad_norm": 0.05708112567663193,
"learning_rate": 1.339745962155613e-05,
"loss": 0.077,
"mean_token_accuracy": 0.9726677536964417,
"num_tokens": 1898894.0,
"step": 328
},
{
"epoch": 4.165605095541402,
"grad_norm": 0.06049314886331558,
"learning_rate": 1.2984900807073919e-05,
"loss": 0.0788,
"mean_token_accuracy": 0.9703496098518372,
"num_tokens": 1904694.0,
"step": 329
},
{
"epoch": 4.178343949044586,
"grad_norm": 0.05979952961206436,
"learning_rate": 1.2578352460261456e-05,
"loss": 0.0765,
"mean_token_accuracy": 0.9704856276512146,
"num_tokens": 1910650.0,
"step": 330
},
{
"epoch": 4.191082802547771,
"grad_norm": 0.057836275547742844,
"learning_rate": 1.2177842662977135e-05,
"loss": 0.0772,
"mean_token_accuracy": 0.9702738225460052,
"num_tokens": 1916529.0,
"step": 331
},
{
"epoch": 4.203821656050955,
"grad_norm": 0.0649733766913414,
"learning_rate": 1.1783399079973578e-05,
"loss": 0.0819,
"mean_token_accuracy": 0.9693669080734253,
"num_tokens": 1922109.0,
"step": 332
},
{
"epoch": 4.2165605095541405,
"grad_norm": 0.06345295161008835,
"learning_rate": 1.1395048956986575e-05,
"loss": 0.0795,
"mean_token_accuracy": 0.9681398570537567,
"num_tokens": 1927853.0,
"step": 333
},
{
"epoch": 4.229299363057325,
"grad_norm": 0.0727447047829628,
"learning_rate": 1.1012819118853147e-05,
"loss": 0.0785,
"mean_token_accuracy": 0.9697018563747406,
"num_tokens": 1933687.0,
"step": 334
},
{
"epoch": 4.24203821656051,
"grad_norm": 0.06956258416175842,
"learning_rate": 1.0636735967658784e-05,
"loss": 0.0772,
"mean_token_accuracy": 0.9701622724533081,
"num_tokens": 1939559.0,
"step": 335
},
{
"epoch": 4.254777070063694,
"grad_norm": 0.059698961675167084,
"learning_rate": 1.0266825480913611e-05,
"loss": 0.0777,
"mean_token_accuracy": 0.970890462398529,
"num_tokens": 1945360.0,
"step": 336
},
{
"epoch": 4.267515923566879,
"grad_norm": 0.06218119338154793,
"learning_rate": 9.903113209758096e-06,
"loss": 0.0798,
"mean_token_accuracy": 0.9710522294044495,
"num_tokens": 1951088.0,
"step": 337
},
{
"epoch": 4.280254777070064,
"grad_norm": 0.06985397636890411,
"learning_rate": 9.545624277198084e-06,
"loss": 0.078,
"mean_token_accuracy": 0.9670553207397461,
"num_tokens": 1956950.0,
"step": 338
},
{
"epoch": 4.292993630573249,
"grad_norm": 0.07117420434951782,
"learning_rate": 9.194383376369508e-06,
"loss": 0.0792,
"mean_token_accuracy": 0.9684776067733765,
"num_tokens": 1962762.0,
"step": 339
},
{
"epoch": 4.305732484076433,
"grad_norm": 0.06108011677861214,
"learning_rate": 8.849414768832687e-06,
"loss": 0.0755,
"mean_token_accuracy": 0.9709950089454651,
"num_tokens": 1968759.0,
"step": 340
},
{
"epoch": 4.318471337579618,
"grad_norm": 0.06510091572999954,
"learning_rate": 8.510742282896544e-06,
"loss": 0.0786,
"mean_token_accuracy": 0.970602422952652,
"num_tokens": 1974572.0,
"step": 341
},
{
"epoch": 4.3312101910828025,
"grad_norm": 0.0644499734044075,
"learning_rate": 8.178389311972612e-06,
"loss": 0.0778,
"mean_token_accuracy": 0.9694929718971252,
"num_tokens": 1980407.0,
"step": 342
},
{
"epoch": 4.343949044585988,
"grad_norm": 0.058488596230745316,
"learning_rate": 7.852378812959227e-06,
"loss": 0.0792,
"mean_token_accuracy": 0.9711317121982574,
"num_tokens": 1986119.0,
"step": 343
},
{
"epoch": 4.356687898089172,
"grad_norm": 0.05837323144078255,
"learning_rate": 7.532733304655848e-06,
"loss": 0.0762,
"mean_token_accuracy": 0.9707688689231873,
"num_tokens": 1992089.0,
"step": 344
},
{
"epoch": 4.369426751592357,
"grad_norm": 0.059929024428129196,
"learning_rate": 7.219474866207465e-06,
"loss": 0.0767,
"mean_token_accuracy": 0.9722721874713898,
"num_tokens": 1998032.0,
"step": 345
},
{
"epoch": 4.382165605095541,
"grad_norm": 0.05968823283910751,
"learning_rate": 6.9126251355795864e-06,
"loss": 0.0783,
"mean_token_accuracy": 0.9689368605613708,
"num_tokens": 2003860.0,
"step": 346
},
{
"epoch": 4.3949044585987265,
"grad_norm": 0.05450170114636421,
"learning_rate": 6.612205308063646e-06,
"loss": 0.0785,
"mean_token_accuracy": 0.9694878160953522,
"num_tokens": 2009626.0,
"step": 347
},
{
"epoch": 4.407643312101911,
"grad_norm": 0.05428183823823929,
"learning_rate": 6.318236134812916e-06,
"loss": 0.0784,
"mean_token_accuracy": 0.9704253375530243,
"num_tokens": 2015435.0,
"step": 348
},
{
"epoch": 4.420382165605096,
"grad_norm": 0.05976434424519539,
"learning_rate": 6.030737921409169e-06,
"loss": 0.0783,
"mean_token_accuracy": 0.970320075750351,
"num_tokens": 2021227.0,
"step": 349
},
{
"epoch": 4.43312101910828,
"grad_norm": 0.06043943390250206,
"learning_rate": 5.749730526460073e-06,
"loss": 0.0749,
"mean_token_accuracy": 0.9729211330413818,
"num_tokens": 2027234.0,
"step": 350
},
{
"epoch": 4.445859872611465,
"grad_norm": 0.06649263948202133,
"learning_rate": 5.475233360227516e-06,
"loss": 0.0756,
"mean_token_accuracy": 0.9716574847698212,
"num_tokens": 2033228.0,
"step": 351
},
{
"epoch": 4.45859872611465,
"grad_norm": 0.06697969883680344,
"learning_rate": 5.20726538328683e-06,
"loss": 0.0796,
"mean_token_accuracy": 0.9695867598056793,
"num_tokens": 2038987.0,
"step": 352
},
{
"epoch": 4.471337579617835,
"grad_norm": 0.06180531159043312,
"learning_rate": 4.945845105217117e-06,
"loss": 0.0781,
"mean_token_accuracy": 0.9703608751296997,
"num_tokens": 2044820.0,
"step": 353
},
{
"epoch": 4.484076433121019,
"grad_norm": 0.05783803015947342,
"learning_rate": 4.6909905833226966e-06,
"loss": 0.0764,
"mean_token_accuracy": 0.970343828201294,
"num_tokens": 2050785.0,
"step": 354
},
{
"epoch": 4.496815286624204,
"grad_norm": 0.060383569449186325,
"learning_rate": 4.442719421385922e-06,
"loss": 0.0775,
"mean_token_accuracy": 0.9695878624916077,
"num_tokens": 2056669.0,
"step": 355
},
{
"epoch": 4.509554140127388,
"grad_norm": 0.06414959579706192,
"learning_rate": 4.20104876845111e-06,
"loss": 0.0766,
"mean_token_accuracy": 0.9721693992614746,
"num_tokens": 2062624.0,
"step": 356
},
{
"epoch": 4.522292993630574,
"grad_norm": 0.06533105671405792,
"learning_rate": 3.965995317640025e-06,
"loss": 0.0799,
"mean_token_accuracy": 0.971125453710556,
"num_tokens": 2068300.0,
"step": 357
},
{
"epoch": 4.535031847133758,
"grad_norm": 0.06648838520050049,
"learning_rate": 3.7375753049987973e-06,
"loss": 0.0806,
"mean_token_accuracy": 0.9695271253585815,
"num_tokens": 2074009.0,
"step": 358
},
{
"epoch": 4.547770700636943,
"grad_norm": 0.058792997151613235,
"learning_rate": 3.515804508376508e-06,
"loss": 0.078,
"mean_token_accuracy": 0.9697879552841187,
"num_tokens": 2079834.0,
"step": 359
},
{
"epoch": 4.560509554140127,
"grad_norm": 0.06607222557067871,
"learning_rate": 3.3006982463352766e-06,
"loss": 0.0781,
"mean_token_accuracy": 0.9716702103614807,
"num_tokens": 2085652.0,
"step": 360
},
{
"epoch": 4.573248407643312,
"grad_norm": 0.06878670305013657,
"learning_rate": 3.092271377092215e-06,
"loss": 0.0809,
"mean_token_accuracy": 0.9681178033351898,
"num_tokens": 2091301.0,
"step": 361
},
{
"epoch": 4.585987261146497,
"grad_norm": 0.058448392897844315,
"learning_rate": 2.8905382974930172e-06,
"loss": 0.0768,
"mean_token_accuracy": 0.9709600508213043,
"num_tokens": 2097184.0,
"step": 362
},
{
"epoch": 4.598726114649682,
"grad_norm": 0.06631723046302795,
"learning_rate": 2.6955129420176196e-06,
"loss": 0.0793,
"mean_token_accuracy": 0.9696679413318634,
"num_tokens": 2102888.0,
"step": 363
},
{
"epoch": 4.611464968152866,
"grad_norm": 0.0600939579308033,
"learning_rate": 2.5072087818176382e-06,
"loss": 0.079,
"mean_token_accuracy": 0.9714162647724152,
"num_tokens": 2108623.0,
"step": 364
},
{
"epoch": 4.624203821656051,
"grad_norm": 0.06584436446428299,
"learning_rate": 2.3256388237858807e-06,
"loss": 0.0779,
"mean_token_accuracy": 0.9710645079612732,
"num_tokens": 2114459.0,
"step": 365
},
{
"epoch": 4.6369426751592355,
"grad_norm": 0.07528127729892731,
"learning_rate": 2.150815609657875e-06,
"loss": 0.0784,
"mean_token_accuracy": 0.9690390229225159,
"num_tokens": 2120272.0,
"step": 366
},
{
"epoch": 4.649681528662421,
"grad_norm": 0.06594248861074448,
"learning_rate": 1.9827512151456173e-06,
"loss": 0.0796,
"mean_token_accuracy": 0.9691379368305206,
"num_tokens": 2126006.0,
"step": 367
},
{
"epoch": 4.662420382165605,
"grad_norm": 0.06654694676399231,
"learning_rate": 1.8214572491034198e-06,
"loss": 0.0774,
"mean_token_accuracy": 0.9702095985412598,
"num_tokens": 2131911.0,
"step": 368
},
{
"epoch": 4.67515923566879,
"grad_norm": 0.0618974044919014,
"learning_rate": 1.66694485272606e-06,
"loss": 0.0786,
"mean_token_accuracy": 0.9681550562381744,
"num_tokens": 2137688.0,
"step": 369
},
{
"epoch": 4.687898089171974,
"grad_norm": 0.0657062903046608,
"learning_rate": 1.5192246987791981e-06,
"loss": 0.0802,
"mean_token_accuracy": 0.971093088388443,
"num_tokens": 2143366.0,
"step": 370
},
{
"epoch": 4.7006369426751595,
"grad_norm": 0.06324117630720139,
"learning_rate": 1.378306990862177e-06,
"loss": 0.0797,
"mean_token_accuracy": 0.9696191847324371,
"num_tokens": 2149061.0,
"step": 371
},
{
"epoch": 4.713375796178344,
"grad_norm": 0.0632597953081131,
"learning_rate": 1.2442014627032316e-06,
"loss": 0.0792,
"mean_token_accuracy": 0.9695380628108978,
"num_tokens": 2154811.0,
"step": 372
},
{
"epoch": 4.726114649681529,
"grad_norm": 0.06053202226758003,
"learning_rate": 1.1169173774871478e-06,
"loss": 0.0791,
"mean_token_accuracy": 0.9680384993553162,
"num_tokens": 2160537.0,
"step": 373
},
{
"epoch": 4.738853503184713,
"grad_norm": 0.0606355220079422,
"learning_rate": 9.964635272153633e-07,
"loss": 0.0791,
"mean_token_accuracy": 0.9689740240573883,
"num_tokens": 2166303.0,
"step": 374
},
{
"epoch": 4.751592356687898,
"grad_norm": 0.06181586533784866,
"learning_rate": 8.828482320987319e-07,
"loss": 0.0766,
"mean_token_accuracy": 0.9720552563667297,
"num_tokens": 2172164.0,
"step": 375
},
{
"epoch": 4.764331210191083,
"grad_norm": 0.05536742880940437,
"learning_rate": 7.760793399827937e-07,
"loss": 0.0793,
"mean_token_accuracy": 0.9690763354301453,
"num_tokens": 2177887.0,
"step": 376
},
{
"epoch": 4.777070063694268,
"grad_norm": 0.06547785550355911,
"learning_rate": 6.761642258056978e-07,
"loss": 0.0809,
"mean_token_accuracy": 0.9702487289905548,
"num_tokens": 2183503.0,
"step": 377
},
{
"epoch": 4.789808917197452,
"grad_norm": 0.05271998047828674,
"learning_rate": 5.831097910887873e-07,
"loss": 0.0758,
"mean_token_accuracy": 0.9729253947734833,
"num_tokens": 2189517.0,
"step": 378
},
{
"epoch": 4.802547770700637,
"grad_norm": 0.06334082037210464,
"learning_rate": 4.969224634598591e-07,
"loss": 0.0812,
"mean_token_accuracy": 0.9676134288311005,
"num_tokens": 2195138.0,
"step": 379
},
{
"epoch": 4.8152866242038215,
"grad_norm": 0.061048589646816254,
"learning_rate": 4.176081962092182e-07,
"loss": 0.0769,
"mean_token_accuracy": 0.9716890752315521,
"num_tokens": 2201076.0,
"step": 380
},
{
"epoch": 4.828025477707007,
"grad_norm": 0.0601130872964859,
"learning_rate": 3.451724678784518e-07,
"loss": 0.0776,
"mean_token_accuracy": 0.9713118970394135,
"num_tokens": 2206957.0,
"step": 381
},
{
"epoch": 4.840764331210191,
"grad_norm": 0.06541354209184647,
"learning_rate": 2.7962028188198706e-07,
"loss": 0.0779,
"mean_token_accuracy": 0.9702816605567932,
"num_tokens": 2212811.0,
"step": 382
},
{
"epoch": 4.853503184713376,
"grad_norm": 0.0606137290596962,
"learning_rate": 2.2095616616150115e-07,
"loss": 0.0771,
"mean_token_accuracy": 0.9705968499183655,
"num_tokens": 2218678.0,
"step": 383
},
{
"epoch": 4.86624203821656,
"grad_norm": 0.055149566382169724,
"learning_rate": 1.6918417287318245e-07,
"loss": 0.0758,
"mean_token_accuracy": 0.9703577160835266,
"num_tokens": 2224646.0,
"step": 384
},
{
"epoch": 4.8789808917197455,
"grad_norm": 0.06124762445688248,
"learning_rate": 1.2430787810776555e-07,
"loss": 0.078,
"mean_token_accuracy": 0.9694724678993225,
"num_tokens": 2230443.0,
"step": 385
},
{
"epoch": 4.89171974522293,
"grad_norm": 0.06068001314997673,
"learning_rate": 8.633038164358454e-08,
"loss": 0.0797,
"mean_token_accuracy": 0.9697386026382446,
"num_tokens": 2236122.0,
"step": 386
},
{
"epoch": 4.904458598726115,
"grad_norm": 0.062143564224243164,
"learning_rate": 5.5254306732444025e-08,
"loss": 0.0797,
"mean_token_accuracy": 0.9676413536071777,
"num_tokens": 2241814.0,
"step": 387
},
{
"epoch": 4.917197452229299,
"grad_norm": 0.06379738450050354,
"learning_rate": 3.1081799918375454e-08,
"loss": 0.0779,
"mean_token_accuracy": 0.9711249768733978,
"num_tokens": 2247663.0,
"step": 388
},
{
"epoch": 4.929936305732484,
"grad_norm": 0.0583631657063961,
"learning_rate": 1.3814530889433296e-08,
"loss": 0.0779,
"mean_token_accuracy": 0.9712766408920288,
"num_tokens": 2253503.0,
"step": 389
},
{
"epoch": 4.942675159235669,
"grad_norm": 0.06559808552265167,
"learning_rate": 3.453692362309635e-09,
"loss": 0.0803,
"mean_token_accuracy": 0.9672435522079468,
"num_tokens": 2259188.0,
"step": 390
},
{
"epoch": 4.942675159235669,
"step": 390,
"total_flos": 1.3032179915292672e+17,
"train_loss": 0.14372745089423963,
"train_runtime": 625.5073,
"train_samples_per_second": 39.968,
"train_steps_per_second": 0.623
}
],
"logging_steps": 1.0,
"max_steps": 390,
"num_input_tokens_seen": 0,
"num_train_epochs": 5,
"save_steps": 100,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": true
},
"attributes": {}
}
},
"total_flos": 1.3032179915292672e+17,
"train_batch_size": 8,
"trial_name": null,
"trial_params": null
}