LLM-continual-learning / trace /seq /order3 /trainer_state.json
YeMoKoo's picture
Add final checkpoint: trace_seq_order3
906e945 verified
Raw
History Blame Contribute Delete
139 kB
{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 6.917197452229299,
"eval_steps": 500,
"global_step": 546,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.012738853503184714,
"grad_norm": 4.761112689971924,
"learning_rate": 0.0,
"loss": 3.2869,
"mean_token_accuracy": 0.41092178225517273,
"num_tokens": 49462.0,
"step": 1
},
{
"epoch": 0.025477707006369428,
"grad_norm": 4.703872203826904,
"learning_rate": 1.1764705882352942e-05,
"loss": 3.2731,
"mean_token_accuracy": 0.4127148687839508,
"num_tokens": 103343.0,
"step": 2
},
{
"epoch": 0.03821656050955414,
"grad_norm": 4.704084396362305,
"learning_rate": 2.3529411764705884e-05,
"loss": 3.2686,
"mean_token_accuracy": 0.40740063786506653,
"num_tokens": 159396.0,
"step": 3
},
{
"epoch": 0.050955414012738856,
"grad_norm": 3.6533823013305664,
"learning_rate": 3.529411764705883e-05,
"loss": 3.083,
"mean_token_accuracy": 0.42516854405403137,
"num_tokens": 214939.0,
"step": 4
},
{
"epoch": 0.06369426751592357,
"grad_norm": 2.070547342300415,
"learning_rate": 4.705882352941177e-05,
"loss": 2.9803,
"mean_token_accuracy": 0.4312178045511246,
"num_tokens": 269347.0,
"step": 5
},
{
"epoch": 0.07643312101910828,
"grad_norm": 0.8171060085296631,
"learning_rate": 5.882352941176471e-05,
"loss": 2.8637,
"mean_token_accuracy": 0.4366413652896881,
"num_tokens": 322665.0,
"step": 6
},
{
"epoch": 0.08917197452229299,
"grad_norm": 1.5951858758926392,
"learning_rate": 7.058823529411765e-05,
"loss": 2.791,
"mean_token_accuracy": 0.44802916049957275,
"num_tokens": 376321.0,
"step": 7
},
{
"epoch": 0.10191082802547771,
"grad_norm": 1.059572696685791,
"learning_rate": 8.23529411764706e-05,
"loss": 2.761,
"mean_token_accuracy": 0.44592560827732086,
"num_tokens": 432471.0,
"step": 8
},
{
"epoch": 0.11464968152866242,
"grad_norm": 0.7089035511016846,
"learning_rate": 9.411764705882353e-05,
"loss": 2.6454,
"mean_token_accuracy": 0.4627067297697067,
"num_tokens": 484508.0,
"step": 9
},
{
"epoch": 0.12738853503184713,
"grad_norm": 0.6159243583679199,
"learning_rate": 0.00010588235294117647,
"loss": 2.6692,
"mean_token_accuracy": 0.45023128390312195,
"num_tokens": 539575.0,
"step": 10
},
{
"epoch": 0.14012738853503184,
"grad_norm": 0.4188247621059418,
"learning_rate": 0.00011764705882352942,
"loss": 2.6219,
"mean_token_accuracy": 0.45925579965114594,
"num_tokens": 595661.0,
"step": 11
},
{
"epoch": 0.15286624203821655,
"grad_norm": 0.4733411371707916,
"learning_rate": 0.00012941176470588237,
"loss": 2.5438,
"mean_token_accuracy": 0.4694492220878601,
"num_tokens": 649252.0,
"step": 12
},
{
"epoch": 0.16560509554140126,
"grad_norm": 0.5128419995307922,
"learning_rate": 0.0001411764705882353,
"loss": 2.4735,
"mean_token_accuracy": 0.4854963421821594,
"num_tokens": 698181.0,
"step": 13
},
{
"epoch": 0.17834394904458598,
"grad_norm": 0.3656497597694397,
"learning_rate": 0.00015294117647058822,
"loss": 2.5031,
"mean_token_accuracy": 0.4764190912246704,
"num_tokens": 751997.0,
"step": 14
},
{
"epoch": 0.1910828025477707,
"grad_norm": 0.3084503412246704,
"learning_rate": 0.0001647058823529412,
"loss": 2.5714,
"mean_token_accuracy": 0.46718260645866394,
"num_tokens": 804157.0,
"step": 15
},
{
"epoch": 0.20382165605095542,
"grad_norm": 0.36686044931411743,
"learning_rate": 0.00017647058823529413,
"loss": 2.4946,
"mean_token_accuracy": 0.4779031127691269,
"num_tokens": 857853.0,
"step": 16
},
{
"epoch": 0.21656050955414013,
"grad_norm": 0.29674139618873596,
"learning_rate": 0.00018823529411764707,
"loss": 2.5163,
"mean_token_accuracy": 0.4771920293569565,
"num_tokens": 911658.0,
"step": 17
},
{
"epoch": 0.22929936305732485,
"grad_norm": 0.2850172817707062,
"learning_rate": 0.0002,
"loss": 2.4394,
"mean_token_accuracy": 0.4859432280063629,
"num_tokens": 966472.0,
"step": 18
},
{
"epoch": 0.24203821656050956,
"grad_norm": 0.35271042585372925,
"learning_rate": 0.00019999823657444873,
"loss": 2.4561,
"mean_token_accuracy": 0.48405739665031433,
"num_tokens": 1021121.0,
"step": 19
},
{
"epoch": 0.25477707006369427,
"grad_norm": 0.31650495529174805,
"learning_rate": 0.00019999294635998833,
"loss": 2.4687,
"mean_token_accuracy": 0.4840937405824661,
"num_tokens": 1073873.0,
"step": 20
},
{
"epoch": 0.267515923566879,
"grad_norm": 0.2682850658893585,
"learning_rate": 0.00019998412954319675,
"loss": 2.4815,
"mean_token_accuracy": 0.48027853667736053,
"num_tokens": 1127694.0,
"step": 21
},
{
"epoch": 0.2802547770700637,
"grad_norm": 0.2755778431892395,
"learning_rate": 0.00019997178643503004,
"loss": 2.4284,
"mean_token_accuracy": 0.48824429512023926,
"num_tokens": 1182019.0,
"step": 22
},
{
"epoch": 0.2929936305732484,
"grad_norm": 0.24972540140151978,
"learning_rate": 0.00019995591747081122,
"loss": 2.4494,
"mean_token_accuracy": 0.4878968298435211,
"num_tokens": 1236984.0,
"step": 23
},
{
"epoch": 0.3057324840764331,
"grad_norm": 0.2714020013809204,
"learning_rate": 0.000199936523210215,
"loss": 2.4214,
"mean_token_accuracy": 0.48719431459903717,
"num_tokens": 1290713.0,
"step": 24
},
{
"epoch": 0.3184713375796178,
"grad_norm": 0.2532528340816498,
"learning_rate": 0.00019991360433724813,
"loss": 2.4032,
"mean_token_accuracy": 0.4961143136024475,
"num_tokens": 1342478.0,
"step": 25
},
{
"epoch": 0.33121019108280253,
"grad_norm": 0.24254582822322845,
"learning_rate": 0.0001998871616602251,
"loss": 2.4002,
"mean_token_accuracy": 0.4875377267599106,
"num_tokens": 1399050.0,
"step": 26
},
{
"epoch": 0.34394904458598724,
"grad_norm": 0.28501322865486145,
"learning_rate": 0.00019985719611173973,
"loss": 2.3697,
"mean_token_accuracy": 0.4995545297861099,
"num_tokens": 1450903.0,
"step": 27
},
{
"epoch": 0.35668789808917195,
"grad_norm": 0.23500725626945496,
"learning_rate": 0.00019982370874863236,
"loss": 2.4132,
"mean_token_accuracy": 0.4906390905380249,
"num_tokens": 1502703.0,
"step": 28
},
{
"epoch": 0.36942675159235666,
"grad_norm": 0.30180564522743225,
"learning_rate": 0.0001997867007519524,
"loss": 2.3696,
"mean_token_accuracy": 0.49948596954345703,
"num_tokens": 1554830.0,
"step": 29
},
{
"epoch": 0.3821656050955414,
"grad_norm": 0.2490658164024353,
"learning_rate": 0.00019974617342691678,
"loss": 2.3408,
"mean_token_accuracy": 0.5027014017105103,
"num_tokens": 1608232.0,
"step": 30
},
{
"epoch": 0.39490445859872614,
"grad_norm": 0.24896252155303955,
"learning_rate": 0.00019970212820286394,
"loss": 2.4234,
"mean_token_accuracy": 0.4829110950231552,
"num_tokens": 1664017.0,
"step": 31
},
{
"epoch": 0.40764331210191085,
"grad_norm": 0.25039437413215637,
"learning_rate": 0.00019965456663320329,
"loss": 2.3917,
"mean_token_accuracy": 0.48753800988197327,
"num_tokens": 1720089.0,
"step": 32
},
{
"epoch": 0.42038216560509556,
"grad_norm": 0.22132936120033264,
"learning_rate": 0.00019960349039536062,
"loss": 2.3627,
"mean_token_accuracy": 0.4972927123308182,
"num_tokens": 1774726.0,
"step": 33
},
{
"epoch": 0.43312101910828027,
"grad_norm": 0.2938268780708313,
"learning_rate": 0.00019954890129071876,
"loss": 2.2881,
"mean_token_accuracy": 0.5129408538341522,
"num_tokens": 1825040.0,
"step": 34
},
{
"epoch": 0.445859872611465,
"grad_norm": 0.24302712082862854,
"learning_rate": 0.00019949080124455416,
"loss": 2.2596,
"mean_token_accuracy": 0.5119624435901642,
"num_tokens": 1874103.0,
"step": 35
},
{
"epoch": 0.4585987261146497,
"grad_norm": 0.2339584231376648,
"learning_rate": 0.00019942919230596896,
"loss": 2.3253,
"mean_token_accuracy": 0.5040525794029236,
"num_tokens": 1927131.0,
"step": 36
},
{
"epoch": 0.4713375796178344,
"grad_norm": 0.2367529571056366,
"learning_rate": 0.00019936407664781868,
"loss": 2.3364,
"mean_token_accuracy": 0.49800464510917664,
"num_tokens": 1980917.0,
"step": 37
},
{
"epoch": 0.4840764331210191,
"grad_norm": 0.2430427372455597,
"learning_rate": 0.00019929545656663562,
"loss": 2.3208,
"mean_token_accuracy": 0.5083869993686676,
"num_tokens": 2038766.0,
"step": 38
},
{
"epoch": 0.4968152866242038,
"grad_norm": 0.23850445449352264,
"learning_rate": 0.00019922333448254786,
"loss": 2.2224,
"mean_token_accuracy": 0.51767298579216,
"num_tokens": 2091004.0,
"step": 39
},
{
"epoch": 0.5095541401273885,
"grad_norm": 0.24451673030853271,
"learning_rate": 0.00019914771293919395,
"loss": 2.2564,
"mean_token_accuracy": 0.5176732242107391,
"num_tokens": 2140073.0,
"step": 40
},
{
"epoch": 0.5222929936305732,
"grad_norm": 0.24077007174491882,
"learning_rate": 0.00019906859460363307,
"loss": 2.269,
"mean_token_accuracy": 0.5150171518325806,
"num_tokens": 2188061.0,
"step": 41
},
{
"epoch": 0.535031847133758,
"grad_norm": 0.24033866822719574,
"learning_rate": 0.00019898598226625119,
"loss": 2.3521,
"mean_token_accuracy": 0.5002244710922241,
"num_tokens": 2238848.0,
"step": 42
},
{
"epoch": 0.5477707006369427,
"grad_norm": 0.26337239146232605,
"learning_rate": 0.00019889987884066237,
"loss": 2.289,
"mean_token_accuracy": 0.5045580565929413,
"num_tokens": 2290423.0,
"step": 43
},
{
"epoch": 0.5605095541401274,
"grad_norm": 0.25623688101768494,
"learning_rate": 0.00019881028736360622,
"loss": 2.3905,
"mean_token_accuracy": 0.49077165126800537,
"num_tokens": 2346796.0,
"step": 44
},
{
"epoch": 0.5732484076433121,
"grad_norm": 0.2281937599182129,
"learning_rate": 0.0001987172109948408,
"loss": 2.2994,
"mean_token_accuracy": 0.5028359293937683,
"num_tokens": 2398134.0,
"step": 45
},
{
"epoch": 0.5859872611464968,
"grad_norm": 0.27723079919815063,
"learning_rate": 0.000198620653017031,
"loss": 2.288,
"mean_token_accuracy": 0.5047226399183273,
"num_tokens": 2451183.0,
"step": 46
},
{
"epoch": 0.5987261146496815,
"grad_norm": 0.2861751317977905,
"learning_rate": 0.00019852061683563296,
"loss": 2.2769,
"mean_token_accuracy": 0.5117324590682983,
"num_tokens": 2504378.0,
"step": 47
},
{
"epoch": 0.6114649681528662,
"grad_norm": 0.23169028759002686,
"learning_rate": 0.00019841710597877382,
"loss": 2.3068,
"mean_token_accuracy": 0.5017941743135452,
"num_tokens": 2560111.0,
"step": 48
},
{
"epoch": 0.6242038216560509,
"grad_norm": 0.27773961424827576,
"learning_rate": 0.00019831012409712737,
"loss": 2.2841,
"mean_token_accuracy": 0.503075584769249,
"num_tokens": 2615347.0,
"step": 49
},
{
"epoch": 0.6369426751592356,
"grad_norm": 0.2665307819843292,
"learning_rate": 0.0001981996749637853,
"loss": 2.2756,
"mean_token_accuracy": 0.5119664669036865,
"num_tokens": 2668557.0,
"step": 50
},
{
"epoch": 0.6496815286624203,
"grad_norm": 0.22537562251091003,
"learning_rate": 0.0001980857624741241,
"loss": 2.2294,
"mean_token_accuracy": 0.5203698873519897,
"num_tokens": 2719222.0,
"step": 51
},
{
"epoch": 0.6624203821656051,
"grad_norm": 0.25558340549468994,
"learning_rate": 0.00019796839064566761,
"loss": 2.3334,
"mean_token_accuracy": 0.4992421716451645,
"num_tokens": 2774066.0,
"step": 52
},
{
"epoch": 0.6751592356687898,
"grad_norm": 0.20945656299591064,
"learning_rate": 0.00019784756361794555,
"loss": 2.2214,
"mean_token_accuracy": 0.517143189907074,
"num_tokens": 2826453.0,
"step": 53
},
{
"epoch": 0.6878980891719745,
"grad_norm": 0.23105494678020477,
"learning_rate": 0.00019772328565234717,
"loss": 2.2567,
"mean_token_accuracy": 0.5205609798431396,
"num_tokens": 2879916.0,
"step": 54
},
{
"epoch": 0.7006369426751592,
"grad_norm": 0.23229676485061646,
"learning_rate": 0.00019759556113197135,
"loss": 2.2873,
"mean_token_accuracy": 0.5090361982584,
"num_tokens": 2935627.0,
"step": 55
},
{
"epoch": 0.7133757961783439,
"grad_norm": 0.2351050078868866,
"learning_rate": 0.00019746439456147172,
"loss": 2.2766,
"mean_token_accuracy": 0.5134994685649872,
"num_tokens": 2987299.0,
"step": 56
},
{
"epoch": 0.7261146496815286,
"grad_norm": 0.24870601296424866,
"learning_rate": 0.00019732979056689794,
"loss": 2.2205,
"mean_token_accuracy": 0.522331178188324,
"num_tokens": 3039920.0,
"step": 57
},
{
"epoch": 0.7388535031847133,
"grad_norm": 0.28598159551620483,
"learning_rate": 0.00019719175389553242,
"loss": 2.1919,
"mean_token_accuracy": 0.52306267619133,
"num_tokens": 3093758.0,
"step": 58
},
{
"epoch": 0.7515923566878981,
"grad_norm": 0.21852071583271027,
"learning_rate": 0.00019705028941572307,
"loss": 2.2348,
"mean_token_accuracy": 0.5180289447307587,
"num_tokens": 3146320.0,
"step": 59
},
{
"epoch": 0.7643312101910829,
"grad_norm": 0.3433847427368164,
"learning_rate": 0.00019690540211671144,
"loss": 2.2131,
"mean_token_accuracy": 0.523471474647522,
"num_tokens": 3199447.0,
"step": 60
},
{
"epoch": 0.7770700636942676,
"grad_norm": 0.24704255163669586,
"learning_rate": 0.00019675709710845687,
"loss": 2.2278,
"mean_token_accuracy": 0.5203054547309875,
"num_tokens": 3249325.0,
"step": 61
},
{
"epoch": 0.7898089171974523,
"grad_norm": 0.2434249073266983,
"learning_rate": 0.0001966053796214561,
"loss": 2.1922,
"mean_token_accuracy": 0.5255579054355621,
"num_tokens": 3301933.0,
"step": 62
},
{
"epoch": 0.802547770700637,
"grad_norm": 0.2141779363155365,
"learning_rate": 0.00019645025500655906,
"loss": 2.3071,
"mean_token_accuracy": 0.5049006342887878,
"num_tokens": 3359168.0,
"step": 63
},
{
"epoch": 0.8152866242038217,
"grad_norm": 0.2301589697599411,
"learning_rate": 0.00019629172873477995,
"loss": 2.2495,
"mean_token_accuracy": 0.5104150474071503,
"num_tokens": 3413805.0,
"step": 64
},
{
"epoch": 0.8280254777070064,
"grad_norm": 0.2124495804309845,
"learning_rate": 0.00019612980639710428,
"loss": 2.2455,
"mean_token_accuracy": 0.5139024257659912,
"num_tokens": 3468018.0,
"step": 65
},
{
"epoch": 0.8407643312101911,
"grad_norm": 0.22220134735107422,
"learning_rate": 0.00019596449370429183,
"loss": 2.1932,
"mean_token_accuracy": 0.5238142609596252,
"num_tokens": 3520245.0,
"step": 66
},
{
"epoch": 0.8535031847133758,
"grad_norm": 0.2254519909620285,
"learning_rate": 0.0001957957964866751,
"loss": 2.2676,
"mean_token_accuracy": 0.5060286223888397,
"num_tokens": 3575996.0,
"step": 67
},
{
"epoch": 0.8662420382165605,
"grad_norm": 0.24107247591018677,
"learning_rate": 0.00019562372069395384,
"loss": 2.1719,
"mean_token_accuracy": 0.529631108045578,
"num_tokens": 3626048.0,
"step": 68
},
{
"epoch": 0.8789808917197452,
"grad_norm": 0.233174666762352,
"learning_rate": 0.000195448272394985,
"loss": 2.2928,
"mean_token_accuracy": 0.5004236400127411,
"num_tokens": 3680891.0,
"step": 69
},
{
"epoch": 0.89171974522293,
"grad_norm": 0.2761193513870239,
"learning_rate": 0.00019526945777756879,
"loss": 2.1389,
"mean_token_accuracy": 0.5384191572666168,
"num_tokens": 3734485.0,
"step": 70
},
{
"epoch": 0.9044585987261147,
"grad_norm": 0.2387181967496872,
"learning_rate": 0.00019508728314823062,
"loss": 2.2644,
"mean_token_accuracy": 0.5090985596179962,
"num_tokens": 3788386.0,
"step": 71
},
{
"epoch": 0.9171974522292994,
"grad_norm": 0.2362382709980011,
"learning_rate": 0.00019490175493199833,
"loss": 2.2815,
"mean_token_accuracy": 0.5037011504173279,
"num_tokens": 3844848.0,
"step": 72
},
{
"epoch": 0.9299363057324841,
"grad_norm": 0.22168081998825073,
"learning_rate": 0.00019471287967217594,
"loss": 2.2043,
"mean_token_accuracy": 0.5228941738605499,
"num_tokens": 3897780.0,
"step": 73
},
{
"epoch": 0.9426751592356688,
"grad_norm": 0.2153845578432083,
"learning_rate": 0.00019452066403011253,
"loss": 2.2061,
"mean_token_accuracy": 0.521478921175003,
"num_tokens": 3951508.0,
"step": 74
},
{
"epoch": 0.9554140127388535,
"grad_norm": 0.2467203289270401,
"learning_rate": 0.00019432511478496768,
"loss": 2.2269,
"mean_token_accuracy": 0.5161807537078857,
"num_tokens": 4005526.0,
"step": 75
},
{
"epoch": 0.9681528662420382,
"grad_norm": 0.2676069140434265,
"learning_rate": 0.00019412623883347207,
"loss": 2.2885,
"mean_token_accuracy": 0.5052478164434433,
"num_tokens": 4060883.0,
"step": 76
},
{
"epoch": 0.9808917197452229,
"grad_norm": 0.3622201979160309,
"learning_rate": 0.0001939240431896844,
"loss": 2.2456,
"mean_token_accuracy": 0.513193815946579,
"num_tokens": 4116720.0,
"step": 77
},
{
"epoch": 0.9936305732484076,
"grad_norm": 0.28581345081329346,
"learning_rate": 0.0001937185349847439,
"loss": 2.2372,
"mean_token_accuracy": 0.5164882987737656,
"num_tokens": 4171909.0,
"step": 78
},
{
"epoch": 1.0,
"grad_norm": 0.28581345081329346,
"learning_rate": 0.00019350972146661905,
"loss": 2.2208,
"mean_token_accuracy": 0.5214709043502808,
"num_tokens": 4196905.0,
"step": 79
},
{
"epoch": 1.0127388535031847,
"grad_norm": 0.4009493887424469,
"learning_rate": 0.00019329760999985167,
"loss": 2.1636,
"mean_token_accuracy": 0.5267406105995178,
"num_tokens": 4250007.0,
"step": 80
},
{
"epoch": 1.0254777070063694,
"grad_norm": 0.43694907426834106,
"learning_rate": 0.00019308220806529738,
"loss": 2.1002,
"mean_token_accuracy": 0.5409376621246338,
"num_tokens": 4301240.0,
"step": 81
},
{
"epoch": 1.0382165605095541,
"grad_norm": 0.2592337429523468,
"learning_rate": 0.00019286352325986164,
"loss": 2.1344,
"mean_token_accuracy": 0.5298282206058502,
"num_tokens": 4355550.0,
"step": 82
},
{
"epoch": 1.0509554140127388,
"grad_norm": 0.3665807545185089,
"learning_rate": 0.00019264156329623197,
"loss": 2.1566,
"mean_token_accuracy": 0.531202495098114,
"num_tokens": 4409847.0,
"step": 83
},
{
"epoch": 1.0636942675159236,
"grad_norm": 0.3309776186943054,
"learning_rate": 0.00019241633600260578,
"loss": 2.064,
"mean_token_accuracy": 0.5411050617694855,
"num_tokens": 4462400.0,
"step": 84
},
{
"epoch": 1.0764331210191083,
"grad_norm": 0.33778995275497437,
"learning_rate": 0.00019218784932241434,
"loss": 2.0934,
"mean_token_accuracy": 0.5414632260799408,
"num_tokens": 4514701.0,
"step": 85
},
{
"epoch": 1.089171974522293,
"grad_norm": 0.30230894684791565,
"learning_rate": 0.0001919561113140427,
"loss": 2.0989,
"mean_token_accuracy": 0.5322273671627045,
"num_tokens": 4568775.0,
"step": 86
},
{
"epoch": 1.1019108280254777,
"grad_norm": 0.2423592060804367,
"learning_rate": 0.00019172113015054532,
"loss": 2.0923,
"mean_token_accuracy": 0.5353631675243378,
"num_tokens": 4620587.0,
"step": 87
},
{
"epoch": 1.1146496815286624,
"grad_norm": 0.3683182895183563,
"learning_rate": 0.00019148291411935796,
"loss": 2.1053,
"mean_token_accuracy": 0.5336830317974091,
"num_tokens": 4673238.0,
"step": 88
},
{
"epoch": 1.127388535031847,
"grad_norm": 0.2518496811389923,
"learning_rate": 0.00019124147162200535,
"loss": 2.0822,
"mean_token_accuracy": 0.540095865726471,
"num_tokens": 4725246.0,
"step": 89
},
{
"epoch": 1.1401273885350318,
"grad_norm": 0.25359344482421875,
"learning_rate": 0.00019099681117380486,
"loss": 2.1159,
"mean_token_accuracy": 0.5306004583835602,
"num_tokens": 4783484.0,
"step": 90
},
{
"epoch": 1.1528662420382165,
"grad_norm": 0.2729495167732239,
"learning_rate": 0.00019074894140356624,
"loss": 2.1016,
"mean_token_accuracy": 0.5280826091766357,
"num_tokens": 4839119.0,
"step": 91
},
{
"epoch": 1.1656050955414012,
"grad_norm": 0.2338961809873581,
"learning_rate": 0.00019049787105328715,
"loss": 2.0787,
"mean_token_accuracy": 0.5392454266548157,
"num_tokens": 4891499.0,
"step": 92
},
{
"epoch": 1.178343949044586,
"grad_norm": 0.25005510449409485,
"learning_rate": 0.00019024360897784508,
"loss": 2.1355,
"mean_token_accuracy": 0.5308442413806915,
"num_tokens": 4945849.0,
"step": 93
},
{
"epoch": 1.1910828025477707,
"grad_norm": 0.2686973214149475,
"learning_rate": 0.00018998616414468478,
"loss": 2.0928,
"mean_token_accuracy": 0.5372393429279327,
"num_tokens": 5002303.0,
"step": 94
},
{
"epoch": 1.2038216560509554,
"grad_norm": 0.2296302765607834,
"learning_rate": 0.0001897255456335022,
"loss": 2.0734,
"mean_token_accuracy": 0.5390827655792236,
"num_tokens": 5054582.0,
"step": 95
},
{
"epoch": 1.21656050955414,
"grad_norm": 0.24622996151447296,
"learning_rate": 0.0001894617626359242,
"loss": 2.0855,
"mean_token_accuracy": 0.5394154489040375,
"num_tokens": 5105256.0,
"step": 96
},
{
"epoch": 1.2292993630573248,
"grad_norm": 0.29459571838378906,
"learning_rate": 0.00018919482445518436,
"loss": 2.0786,
"mean_token_accuracy": 0.5413715243339539,
"num_tokens": 5160210.0,
"step": 97
},
{
"epoch": 1.2420382165605095,
"grad_norm": 0.25291192531585693,
"learning_rate": 0.0001889247405057948,
"loss": 2.1601,
"mean_token_accuracy": 0.5215615034103394,
"num_tokens": 5214515.0,
"step": 98
},
{
"epoch": 1.2547770700636942,
"grad_norm": 0.2828863561153412,
"learning_rate": 0.00018865152031321427,
"loss": 2.0636,
"mean_token_accuracy": 0.5417250990867615,
"num_tokens": 5270473.0,
"step": 99
},
{
"epoch": 1.267515923566879,
"grad_norm": 0.24130484461784363,
"learning_rate": 0.00018837517351351214,
"loss": 2.1423,
"mean_token_accuracy": 0.533792644739151,
"num_tokens": 5325465.0,
"step": 100
},
{
"epoch": 1.2802547770700636,
"grad_norm": 0.26588988304138184,
"learning_rate": 0.00018809570985302862,
"loss": 2.1106,
"mean_token_accuracy": 0.5345290303230286,
"num_tokens": 5378975.0,
"step": 101
},
{
"epoch": 1.2929936305732483,
"grad_norm": 0.23804686963558197,
"learning_rate": 0.00018781313918803086,
"loss": 2.0467,
"mean_token_accuracy": 0.5438741445541382,
"num_tokens": 5429881.0,
"step": 102
},
{
"epoch": 1.305732484076433,
"grad_norm": 0.3126032054424286,
"learning_rate": 0.00018752747148436543,
"loss": 2.1516,
"mean_token_accuracy": 0.5253174304962158,
"num_tokens": 5483872.0,
"step": 103
},
{
"epoch": 1.3184713375796178,
"grad_norm": 0.25495046377182007,
"learning_rate": 0.00018723871681710697,
"loss": 2.1359,
"mean_token_accuracy": 0.5270724594593048,
"num_tokens": 5538427.0,
"step": 104
},
{
"epoch": 1.3312101910828025,
"grad_norm": 0.30238616466522217,
"learning_rate": 0.0001869468853702026,
"loss": 2.0455,
"mean_token_accuracy": 0.5438694357872009,
"num_tokens": 5588718.0,
"step": 105
},
{
"epoch": 1.3439490445859872,
"grad_norm": 0.2548542618751526,
"learning_rate": 0.0001866519874361129,
"loss": 2.1926,
"mean_token_accuracy": 0.5167091488838196,
"num_tokens": 5646062.0,
"step": 106
},
{
"epoch": 1.356687898089172,
"grad_norm": 0.3424091935157776,
"learning_rate": 0.000186354033415449,
"loss": 2.0662,
"mean_token_accuracy": 0.536639928817749,
"num_tokens": 5699150.0,
"step": 107
},
{
"epoch": 1.3694267515923566,
"grad_norm": 0.24927005171775818,
"learning_rate": 0.00018605303381660543,
"loss": 2.1148,
"mean_token_accuracy": 0.5341704487800598,
"num_tokens": 5752117.0,
"step": 108
},
{
"epoch": 1.3821656050955413,
"grad_norm": 0.29815709590911865,
"learning_rate": 0.00018574899925538998,
"loss": 2.0293,
"mean_token_accuracy": 0.547461211681366,
"num_tokens": 5805733.0,
"step": 109
},
{
"epoch": 1.394904458598726,
"grad_norm": 0.23644262552261353,
"learning_rate": 0.00018544194045464886,
"loss": 2.1122,
"mean_token_accuracy": 0.532728523015976,
"num_tokens": 5857780.0,
"step": 110
},
{
"epoch": 1.4076433121019107,
"grad_norm": 0.3198355436325073,
"learning_rate": 0.00018513186824388879,
"loss": 2.0444,
"mean_token_accuracy": 0.5452798306941986,
"num_tokens": 5909706.0,
"step": 111
},
{
"epoch": 1.4203821656050954,
"grad_norm": 0.2513161301612854,
"learning_rate": 0.00018481879355889495,
"loss": 2.0679,
"mean_token_accuracy": 0.5424592792987823,
"num_tokens": 5963429.0,
"step": 112
},
{
"epoch": 1.4331210191082802,
"grad_norm": 0.2995910048484802,
"learning_rate": 0.00018450272744134532,
"loss": 2.0992,
"mean_token_accuracy": 0.5330868661403656,
"num_tokens": 6018349.0,
"step": 113
},
{
"epoch": 1.4458598726114649,
"grad_norm": 0.26617002487182617,
"learning_rate": 0.00018418368103842125,
"loss": 2.0859,
"mean_token_accuracy": 0.5419372916221619,
"num_tokens": 6071380.0,
"step": 114
},
{
"epoch": 1.4585987261146496,
"grad_norm": 0.2854417860507965,
"learning_rate": 0.00018386166560241434,
"loss": 2.0102,
"mean_token_accuracy": 0.5525364279747009,
"num_tokens": 6122148.0,
"step": 115
},
{
"epoch": 1.4713375796178343,
"grad_norm": 0.25919023156166077,
"learning_rate": 0.0001835366924903295,
"loss": 2.0898,
"mean_token_accuracy": 0.5407845079898834,
"num_tokens": 6177776.0,
"step": 116
},
{
"epoch": 1.484076433121019,
"grad_norm": 0.28204745054244995,
"learning_rate": 0.00018320877316348454,
"loss": 2.076,
"mean_token_accuracy": 0.5413212180137634,
"num_tokens": 6226607.0,
"step": 117
},
{
"epoch": 1.4968152866242037,
"grad_norm": 0.25847408175468445,
"learning_rate": 0.00018287791918710587,
"loss": 2.1751,
"mean_token_accuracy": 0.5201755166053772,
"num_tokens": 6282972.0,
"step": 118
},
{
"epoch": 1.5095541401273884,
"grad_norm": 0.26896369457244873,
"learning_rate": 0.0001825441422299206,
"loss": 2.1031,
"mean_token_accuracy": 0.5321025848388672,
"num_tokens": 6337308.0,
"step": 119
},
{
"epoch": 1.5222929936305731,
"grad_norm": 0.2460022270679474,
"learning_rate": 0.00018220745406374498,
"loss": 2.0567,
"mean_token_accuracy": 0.5367059409618378,
"num_tokens": 6392544.0,
"step": 120
},
{
"epoch": 1.5350318471337578,
"grad_norm": 0.2766154706478119,
"learning_rate": 0.00018186786656306935,
"loss": 2.0692,
"mean_token_accuracy": 0.5417434871196747,
"num_tokens": 6445611.0,
"step": 121
},
{
"epoch": 1.5477707006369426,
"grad_norm": 0.2518499493598938,
"learning_rate": 0.00018152539170463925,
"loss": 2.1262,
"mean_token_accuracy": 0.5296519994735718,
"num_tokens": 6500225.0,
"step": 122
},
{
"epoch": 1.5605095541401273,
"grad_norm": 0.28496435284614563,
"learning_rate": 0.00018118004156703296,
"loss": 2.1254,
"mean_token_accuracy": 0.526570588350296,
"num_tokens": 6553560.0,
"step": 123
},
{
"epoch": 1.573248407643312,
"grad_norm": 0.2789745628833771,
"learning_rate": 0.00018083182833023562,
"loss": 1.9918,
"mean_token_accuracy": 0.5569777488708496,
"num_tokens": 6603384.0,
"step": 124
},
{
"epoch": 1.5859872611464967,
"grad_norm": 0.25823691487312317,
"learning_rate": 0.0001804807642752096,
"loss": 2.0228,
"mean_token_accuracy": 0.5478627681732178,
"num_tokens": 6656526.0,
"step": 125
},
{
"epoch": 1.5987261146496814,
"grad_norm": 0.2591652274131775,
"learning_rate": 0.00018012686178346142,
"loss": 2.1509,
"mean_token_accuracy": 0.5273606777191162,
"num_tokens": 6709576.0,
"step": 126
},
{
"epoch": 1.611464968152866,
"grad_norm": 0.2391829490661621,
"learning_rate": 0.000179770133336605,
"loss": 2.1213,
"mean_token_accuracy": 0.5313501060009003,
"num_tokens": 6765322.0,
"step": 127
},
{
"epoch": 1.6242038216560508,
"grad_norm": 0.2610240876674652,
"learning_rate": 0.00017941059151592147,
"loss": 2.051,
"mean_token_accuracy": 0.54247185587883,
"num_tokens": 6819147.0,
"step": 128
},
{
"epoch": 1.6369426751592355,
"grad_norm": 0.24574102461338043,
"learning_rate": 0.00017904824900191556,
"loss": 2.0438,
"mean_token_accuracy": 0.5455809235572815,
"num_tokens": 6871157.0,
"step": 129
},
{
"epoch": 1.6496815286624202,
"grad_norm": 0.2546396255493164,
"learning_rate": 0.0001786831185738682,
"loss": 2.0698,
"mean_token_accuracy": 0.539449006319046,
"num_tokens": 6924990.0,
"step": 130
},
{
"epoch": 1.662420382165605,
"grad_norm": 0.29086804389953613,
"learning_rate": 0.0001783152131093859,
"loss": 2.118,
"mean_token_accuracy": 0.5345580279827118,
"num_tokens": 6978266.0,
"step": 131
},
{
"epoch": 1.6751592356687897,
"grad_norm": 0.37763142585754395,
"learning_rate": 0.00017794454558394657,
"loss": 1.9885,
"mean_token_accuracy": 0.5575284659862518,
"num_tokens": 7029787.0,
"step": 132
},
{
"epoch": 1.6878980891719744,
"grad_norm": 0.32433372735977173,
"learning_rate": 0.000177571129070442,
"loss": 2.0462,
"mean_token_accuracy": 0.5397576093673706,
"num_tokens": 7081794.0,
"step": 133
},
{
"epoch": 1.700636942675159,
"grad_norm": 0.24215054512023926,
"learning_rate": 0.00017719497673871653,
"loss": 2.1465,
"mean_token_accuracy": 0.5300171673297882,
"num_tokens": 7135693.0,
"step": 134
},
{
"epoch": 1.7133757961783438,
"grad_norm": 0.2703648805618286,
"learning_rate": 0.00017681610185510285,
"loss": 2.0875,
"mean_token_accuracy": 0.5355214774608612,
"num_tokens": 7189079.0,
"step": 135
},
{
"epoch": 1.7261146496815285,
"grad_norm": 0.2528088390827179,
"learning_rate": 0.00017643451778195395,
"loss": 2.0384,
"mean_token_accuracy": 0.5461491942405701,
"num_tokens": 7243102.0,
"step": 136
},
{
"epoch": 1.7388535031847132,
"grad_norm": 0.3094780445098877,
"learning_rate": 0.00017605023797717195,
"loss": 2.0923,
"mean_token_accuracy": 0.5363390445709229,
"num_tokens": 7299401.0,
"step": 137
},
{
"epoch": 1.7515923566878981,
"grad_norm": 0.28315144777297974,
"learning_rate": 0.00017566327599373338,
"loss": 2.0433,
"mean_token_accuracy": 0.5426464676856995,
"num_tokens": 7353711.0,
"step": 138
},
{
"epoch": 1.7643312101910829,
"grad_norm": 0.24867816269397736,
"learning_rate": 0.0001752736454792112,
"loss": 2.0688,
"mean_token_accuracy": 0.5372464060783386,
"num_tokens": 7408006.0,
"step": 139
},
{
"epoch": 1.7770700636942676,
"grad_norm": 0.26247575879096985,
"learning_rate": 0.0001748813601752935,
"loss": 2.0498,
"mean_token_accuracy": 0.5413098931312561,
"num_tokens": 7457359.0,
"step": 140
},
{
"epoch": 1.7898089171974523,
"grad_norm": 0.2658616602420807,
"learning_rate": 0.00017448643391729888,
"loss": 2.0639,
"mean_token_accuracy": 0.5411241352558136,
"num_tokens": 7511249.0,
"step": 141
},
{
"epoch": 1.802547770700637,
"grad_norm": 0.26161476969718933,
"learning_rate": 0.0001740888806336884,
"loss": 1.9642,
"mean_token_accuracy": 0.5591636896133423,
"num_tokens": 7563517.0,
"step": 142
},
{
"epoch": 1.8152866242038217,
"grad_norm": 0.27942124009132385,
"learning_rate": 0.00017368871434557447,
"loss": 2.0316,
"mean_token_accuracy": 0.5493811964988708,
"num_tokens": 7617931.0,
"step": 143
},
{
"epoch": 1.8280254777070064,
"grad_norm": 0.27375614643096924,
"learning_rate": 0.00017328594916622616,
"loss": 2.1429,
"mean_token_accuracy": 0.5267685651779175,
"num_tokens": 7673112.0,
"step": 144
},
{
"epoch": 1.8407643312101911,
"grad_norm": 0.254905641078949,
"learning_rate": 0.00017288059930057166,
"loss": 2.0156,
"mean_token_accuracy": 0.5502710938453674,
"num_tokens": 7724812.0,
"step": 145
},
{
"epoch": 1.8535031847133758,
"grad_norm": 0.351695716381073,
"learning_rate": 0.00017247267904469725,
"loss": 2.0889,
"mean_token_accuracy": 0.5358254015445709,
"num_tokens": 7778602.0,
"step": 146
},
{
"epoch": 1.8662420382165605,
"grad_norm": 0.4778117835521698,
"learning_rate": 0.00017206220278534286,
"loss": 2.0909,
"mean_token_accuracy": 0.5361159443855286,
"num_tokens": 7834315.0,
"step": 147
},
{
"epoch": 1.8789808917197452,
"grad_norm": 0.4126635193824768,
"learning_rate": 0.00017164918499939504,
"loss": 2.0449,
"mean_token_accuracy": 0.5419832766056061,
"num_tokens": 7889504.0,
"step": 148
},
{
"epoch": 1.89171974522293,
"grad_norm": 0.24908094108104706,
"learning_rate": 0.0001712336402533761,
"loss": 2.0865,
"mean_token_accuracy": 0.5369491875171661,
"num_tokens": 7942973.0,
"step": 149
},
{
"epoch": 1.9044585987261147,
"grad_norm": 0.3111526370048523,
"learning_rate": 0.00017081558320293055,
"loss": 2.0669,
"mean_token_accuracy": 0.5396228730678558,
"num_tokens": 7996262.0,
"step": 150
},
{
"epoch": 1.9171974522292994,
"grad_norm": 0.2583426833152771,
"learning_rate": 0.000170395028592308,
"loss": 2.0325,
"mean_token_accuracy": 0.5466030538082123,
"num_tokens": 8049642.0,
"step": 151
},
{
"epoch": 1.929936305732484,
"grad_norm": 0.2781616747379303,
"learning_rate": 0.00016997199125384343,
"loss": 2.0315,
"mean_token_accuracy": 0.5470220148563385,
"num_tokens": 8098814.0,
"step": 152
},
{
"epoch": 1.9426751592356688,
"grad_norm": 0.24786719679832458,
"learning_rate": 0.00016954648610743384,
"loss": 2.019,
"mean_token_accuracy": 0.5468859374523163,
"num_tokens": 8153236.0,
"step": 153
},
{
"epoch": 1.9554140127388535,
"grad_norm": 0.28360286355018616,
"learning_rate": 0.0001691185281600122,
"loss": 2.0041,
"mean_token_accuracy": 0.5581452548503876,
"num_tokens": 8202533.0,
"step": 154
},
{
"epoch": 1.9681528662420382,
"grad_norm": 0.2584933638572693,
"learning_rate": 0.0001686881325050181,
"loss": 2.0896,
"mean_token_accuracy": 0.5383184850215912,
"num_tokens": 8258282.0,
"step": 155
},
{
"epoch": 1.980891719745223,
"grad_norm": 0.26692625880241394,
"learning_rate": 0.00016825531432186543,
"loss": 2.1362,
"mean_token_accuracy": 0.5277881026268005,
"num_tokens": 8314231.0,
"step": 156
},
{
"epoch": 1.9936305732484076,
"grad_norm": 0.2702077627182007,
"learning_rate": 0.00016782008887540704,
"loss": 2.0413,
"mean_token_accuracy": 0.5440081357955933,
"num_tokens": 8367791.0,
"step": 157
},
{
"epoch": 2.0,
"grad_norm": 0.4807445704936981,
"learning_rate": 0.00016738247151539643,
"loss": 2.0135,
"mean_token_accuracy": 0.5475367307662964,
"num_tokens": 8394718.0,
"step": 158
},
{
"epoch": 2.0127388535031847,
"grad_norm": 0.3290596306324005,
"learning_rate": 0.00016694247767594624,
"loss": 1.918,
"mean_token_accuracy": 0.5643911361694336,
"num_tokens": 8448629.0,
"step": 159
},
{
"epoch": 2.0254777070063694,
"grad_norm": 0.32206520438194275,
"learning_rate": 0.00016650012287498412,
"loss": 1.8948,
"mean_token_accuracy": 0.5651561915874481,
"num_tokens": 8500589.0,
"step": 160
},
{
"epoch": 2.038216560509554,
"grad_norm": 0.481879323720932,
"learning_rate": 0.00016605542271370513,
"loss": 1.8746,
"mean_token_accuracy": 0.5729745626449585,
"num_tokens": 8553721.0,
"step": 161
},
{
"epoch": 2.050955414012739,
"grad_norm": 0.30145731568336487,
"learning_rate": 0.00016560839287602192,
"loss": 1.9552,
"mean_token_accuracy": 0.5494319200515747,
"num_tokens": 8607953.0,
"step": 162
},
{
"epoch": 2.0636942675159236,
"grad_norm": 0.43942347168922424,
"learning_rate": 0.00016515904912801118,
"loss": 1.8665,
"mean_token_accuracy": 0.5666735470294952,
"num_tokens": 8660147.0,
"step": 163
},
{
"epoch": 2.0764331210191083,
"grad_norm": 0.3917507827281952,
"learning_rate": 0.00016470740731735787,
"loss": 1.8992,
"mean_token_accuracy": 0.5648495852947235,
"num_tokens": 8716453.0,
"step": 164
},
{
"epoch": 2.089171974522293,
"grad_norm": 0.3952564597129822,
"learning_rate": 0.0001642534833727962,
"loss": 1.8559,
"mean_token_accuracy": 0.5734367072582245,
"num_tokens": 8771996.0,
"step": 165
},
{
"epoch": 2.1019108280254777,
"grad_norm": 0.3962686359882355,
"learning_rate": 0.00016379729330354774,
"loss": 1.8981,
"mean_token_accuracy": 0.5651469826698303,
"num_tokens": 8825604.0,
"step": 166
},
{
"epoch": 2.1146496815286624,
"grad_norm": 0.39561396837234497,
"learning_rate": 0.00016333885319875702,
"loss": 1.7526,
"mean_token_accuracy": 0.5901646912097931,
"num_tokens": 8875536.0,
"step": 167
},
{
"epoch": 2.127388535031847,
"grad_norm": 0.34546512365341187,
"learning_rate": 0.00016287817922692395,
"loss": 1.8376,
"mean_token_accuracy": 0.5775989890098572,
"num_tokens": 8926512.0,
"step": 168
},
{
"epoch": 2.140127388535032,
"grad_norm": 0.3792065382003784,
"learning_rate": 0.00016241528763533353,
"loss": 1.8578,
"mean_token_accuracy": 0.5747014582157135,
"num_tokens": 8981202.0,
"step": 169
},
{
"epoch": 2.1528662420382165,
"grad_norm": 0.30425429344177246,
"learning_rate": 0.00016195019474948299,
"loss": 1.8028,
"mean_token_accuracy": 0.5819543302059174,
"num_tokens": 9036791.0,
"step": 170
},
{
"epoch": 2.1656050955414012,
"grad_norm": 0.3416166603565216,
"learning_rate": 0.00016148291697250594,
"loss": 1.8448,
"mean_token_accuracy": 0.5725643932819366,
"num_tokens": 9087595.0,
"step": 171
},
{
"epoch": 2.178343949044586,
"grad_norm": 0.337971031665802,
"learning_rate": 0.00016101347078459373,
"loss": 1.888,
"mean_token_accuracy": 0.5669349431991577,
"num_tokens": 9140895.0,
"step": 172
},
{
"epoch": 2.1910828025477707,
"grad_norm": 0.30838721990585327,
"learning_rate": 0.0001605418727424145,
"loss": 1.8256,
"mean_token_accuracy": 0.5793758928775787,
"num_tokens": 9194795.0,
"step": 173
},
{
"epoch": 2.2038216560509554,
"grad_norm": 0.35549449920654297,
"learning_rate": 0.00016006813947852893,
"loss": 1.9405,
"mean_token_accuracy": 0.5567865371704102,
"num_tokens": 9248301.0,
"step": 174
},
{
"epoch": 2.21656050955414,
"grad_norm": 0.31602397561073303,
"learning_rate": 0.0001595922877008039,
"loss": 1.8156,
"mean_token_accuracy": 0.5829095840454102,
"num_tokens": 9301295.0,
"step": 175
},
{
"epoch": 2.229299363057325,
"grad_norm": 0.3251636028289795,
"learning_rate": 0.00015911433419182305,
"loss": 1.721,
"mean_token_accuracy": 0.6002079248428345,
"num_tokens": 9354095.0,
"step": 176
},
{
"epoch": 2.2420382165605095,
"grad_norm": 0.33418506383895874,
"learning_rate": 0.000158634295808295,
"loss": 1.9674,
"mean_token_accuracy": 0.5512142181396484,
"num_tokens": 9407606.0,
"step": 177
},
{
"epoch": 2.254777070063694,
"grad_norm": 0.3153228461742401,
"learning_rate": 0.00015815218948045878,
"loss": 1.8918,
"mean_token_accuracy": 0.5645856559276581,
"num_tokens": 9461511.0,
"step": 178
},
{
"epoch": 2.267515923566879,
"grad_norm": 0.3489258289337158,
"learning_rate": 0.00015766803221148673,
"loss": 1.797,
"mean_token_accuracy": 0.5782068967819214,
"num_tokens": 9516458.0,
"step": 179
},
{
"epoch": 2.2802547770700636,
"grad_norm": 0.3235794007778168,
"learning_rate": 0.0001571818410768848,
"loss": 1.8385,
"mean_token_accuracy": 0.576362818479538,
"num_tokens": 9566696.0,
"step": 180
},
{
"epoch": 2.2929936305732483,
"grad_norm": 0.33087673783302307,
"learning_rate": 0.0001566936332238904,
"loss": 1.7875,
"mean_token_accuracy": 0.5848988592624664,
"num_tokens": 9616804.0,
"step": 181
},
{
"epoch": 2.305732484076433,
"grad_norm": 0.36274445056915283,
"learning_rate": 0.0001562034258708676,
"loss": 1.8841,
"mean_token_accuracy": 0.5680437088012695,
"num_tokens": 9670221.0,
"step": 182
},
{
"epoch": 2.3184713375796178,
"grad_norm": 0.3127928078174591,
"learning_rate": 0.0001557112363066998,
"loss": 1.9593,
"mean_token_accuracy": 0.5503961145877838,
"num_tokens": 9726367.0,
"step": 183
},
{
"epoch": 2.3312101910828025,
"grad_norm": 0.364726722240448,
"learning_rate": 0.00015521708189018005,
"loss": 1.8904,
"mean_token_accuracy": 0.5647120475769043,
"num_tokens": 9780523.0,
"step": 184
},
{
"epoch": 2.343949044585987,
"grad_norm": 0.3284487724304199,
"learning_rate": 0.00015472098004939888,
"loss": 1.8814,
"mean_token_accuracy": 0.5700592994689941,
"num_tokens": 9836267.0,
"step": 185
},
{
"epoch": 2.356687898089172,
"grad_norm": 0.3258507251739502,
"learning_rate": 0.00015422294828112954,
"loss": 1.8982,
"mean_token_accuracy": 0.5598087012767792,
"num_tokens": 9891684.0,
"step": 186
},
{
"epoch": 2.3694267515923566,
"grad_norm": 0.3135438561439514,
"learning_rate": 0.00015372300415021091,
"loss": 1.8623,
"mean_token_accuracy": 0.5698948800563812,
"num_tokens": 9944113.0,
"step": 187
},
{
"epoch": 2.3821656050955413,
"grad_norm": 0.31163397431373596,
"learning_rate": 0.00015322116528892807,
"loss": 1.8826,
"mean_token_accuracy": 0.5662359297275543,
"num_tokens": 9998424.0,
"step": 188
},
{
"epoch": 2.394904458598726,
"grad_norm": 0.33179372549057007,
"learning_rate": 0.0001527174493963905,
"loss": 1.8688,
"mean_token_accuracy": 0.5694395303726196,
"num_tokens": 10052249.0,
"step": 189
},
{
"epoch": 2.4076433121019107,
"grad_norm": 0.30368921160697937,
"learning_rate": 0.0001522118742379076,
"loss": 1.959,
"mean_token_accuracy": 0.55058753490448,
"num_tokens": 10107567.0,
"step": 190
},
{
"epoch": 2.4203821656050954,
"grad_norm": 0.3139498829841614,
"learning_rate": 0.00015170445764436252,
"loss": 1.7924,
"mean_token_accuracy": 0.5893403887748718,
"num_tokens": 10160504.0,
"step": 191
},
{
"epoch": 2.43312101910828,
"grad_norm": 0.322956919670105,
"learning_rate": 0.00015119521751158296,
"loss": 1.8052,
"mean_token_accuracy": 0.5783436894416809,
"num_tokens": 10215055.0,
"step": 192
},
{
"epoch": 2.445859872611465,
"grad_norm": 0.3144392669200897,
"learning_rate": 0.00015068417179971014,
"loss": 1.8844,
"mean_token_accuracy": 0.5616180300712585,
"num_tokens": 10268601.0,
"step": 193
},
{
"epoch": 2.4585987261146496,
"grad_norm": 0.3140745162963867,
"learning_rate": 0.00015017133853256537,
"loss": 1.8831,
"mean_token_accuracy": 0.567226380109787,
"num_tokens": 10323920.0,
"step": 194
},
{
"epoch": 2.4713375796178343,
"grad_norm": 0.31903892755508423,
"learning_rate": 0.00014965673579701445,
"loss": 1.8734,
"mean_token_accuracy": 0.5720324814319611,
"num_tokens": 10378811.0,
"step": 195
},
{
"epoch": 2.484076433121019,
"grad_norm": 0.31449127197265625,
"learning_rate": 0.00014914038174232956,
"loss": 1.9198,
"mean_token_accuracy": 0.5604428052902222,
"num_tokens": 10430530.0,
"step": 196
},
{
"epoch": 2.4968152866242037,
"grad_norm": 0.31726551055908203,
"learning_rate": 0.0001486222945795494,
"loss": 1.7987,
"mean_token_accuracy": 0.5791361331939697,
"num_tokens": 10483299.0,
"step": 197
},
{
"epoch": 2.5095541401273884,
"grad_norm": 0.3228937089443207,
"learning_rate": 0.00014810249258083677,
"loss": 1.8528,
"mean_token_accuracy": 0.5770910084247589,
"num_tokens": 10537792.0,
"step": 198
},
{
"epoch": 2.522292993630573,
"grad_norm": 0.3331848978996277,
"learning_rate": 0.00014758099407883422,
"loss": 1.8389,
"mean_token_accuracy": 0.5750528275966644,
"num_tokens": 10592498.0,
"step": 199
},
{
"epoch": 2.535031847133758,
"grad_norm": 0.3170086741447449,
"learning_rate": 0.0001470578174660174,
"loss": 1.8815,
"mean_token_accuracy": 0.5696290135383606,
"num_tokens": 10647047.0,
"step": 200
},
{
"epoch": 2.5477707006369426,
"grad_norm": 0.35329344868659973,
"learning_rate": 0.00014653298119404645,
"loss": 1.9293,
"mean_token_accuracy": 0.5669050514698029,
"num_tokens": 10699223.0,
"step": 201
},
{
"epoch": 2.5605095541401273,
"grad_norm": 0.3157745599746704,
"learning_rate": 0.00014600650377311522,
"loss": 1.8966,
"mean_token_accuracy": 0.5621984302997589,
"num_tokens": 10753675.0,
"step": 202
},
{
"epoch": 2.573248407643312,
"grad_norm": 0.36428573727607727,
"learning_rate": 0.00014547840377129842,
"loss": 1.8287,
"mean_token_accuracy": 0.5743198990821838,
"num_tokens": 10806326.0,
"step": 203
},
{
"epoch": 2.5859872611464967,
"grad_norm": 0.33650118112564087,
"learning_rate": 0.0001449486998138968,
"loss": 1.8525,
"mean_token_accuracy": 0.575894296169281,
"num_tokens": 10858399.0,
"step": 204
},
{
"epoch": 2.5987261146496814,
"grad_norm": 0.3885926306247711,
"learning_rate": 0.00014441741058278024,
"loss": 1.9307,
"mean_token_accuracy": 0.5590022504329681,
"num_tokens": 10911133.0,
"step": 205
},
{
"epoch": 2.611464968152866,
"grad_norm": 0.3157569468021393,
"learning_rate": 0.0001438845548157288,
"loss": 1.8093,
"mean_token_accuracy": 0.580660492181778,
"num_tokens": 10966705.0,
"step": 206
},
{
"epoch": 2.624203821656051,
"grad_norm": 0.4603760838508606,
"learning_rate": 0.000143350151305772,
"loss": 1.9015,
"mean_token_accuracy": 0.5635307729244232,
"num_tokens": 11021934.0,
"step": 207
},
{
"epoch": 2.6369426751592355,
"grad_norm": 0.33797430992126465,
"learning_rate": 0.0001428142189005259,
"loss": 1.765,
"mean_token_accuracy": 0.5902499854564667,
"num_tokens": 11074478.0,
"step": 208
},
{
"epoch": 2.6496815286624202,
"grad_norm": 0.4025668799877167,
"learning_rate": 0.0001422767765015285,
"loss": 1.8225,
"mean_token_accuracy": 0.5761205554008484,
"num_tokens": 11127316.0,
"step": 209
},
{
"epoch": 2.662420382165605,
"grad_norm": 0.32198846340179443,
"learning_rate": 0.0001417378430635729,
"loss": 1.8854,
"mean_token_accuracy": 0.5675921738147736,
"num_tokens": 11181761.0,
"step": 210
},
{
"epoch": 2.6751592356687897,
"grad_norm": 0.3658575713634491,
"learning_rate": 0.00014119743759403907,
"loss": 1.8666,
"mean_token_accuracy": 0.5689597129821777,
"num_tokens": 11236998.0,
"step": 211
},
{
"epoch": 2.6878980891719744,
"grad_norm": 0.31915053725242615,
"learning_rate": 0.00014065557915222322,
"loss": 1.9386,
"mean_token_accuracy": 0.555518627166748,
"num_tokens": 11293038.0,
"step": 212
},
{
"epoch": 2.700636942675159,
"grad_norm": 0.3537184000015259,
"learning_rate": 0.00014011228684866582,
"loss": 1.9006,
"mean_token_accuracy": 0.5641106963157654,
"num_tokens": 11346609.0,
"step": 213
},
{
"epoch": 2.713375796178344,
"grad_norm": 0.32953932881355286,
"learning_rate": 0.00013956757984447745,
"loss": 1.8435,
"mean_token_accuracy": 0.5731501877307892,
"num_tokens": 11403344.0,
"step": 214
},
{
"epoch": 2.7261146496815285,
"grad_norm": 0.34561216831207275,
"learning_rate": 0.00013902147735066306,
"loss": 1.8715,
"mean_token_accuracy": 0.5735127329826355,
"num_tokens": 11453752.0,
"step": 215
},
{
"epoch": 2.738853503184713,
"grad_norm": 0.36158326268196106,
"learning_rate": 0.0001384739986274445,
"loss": 1.7981,
"mean_token_accuracy": 0.5859374105930328,
"num_tokens": 11506047.0,
"step": 216
},
{
"epoch": 2.7515923566878984,
"grad_norm": 0.32345420122146606,
"learning_rate": 0.00013792516298358114,
"loss": 1.9462,
"mean_token_accuracy": 0.5512464344501495,
"num_tokens": 11563918.0,
"step": 217
},
{
"epoch": 2.7643312101910826,
"grad_norm": 0.3586336076259613,
"learning_rate": 0.000137374989775689,
"loss": 1.8989,
"mean_token_accuracy": 0.5610895156860352,
"num_tokens": 11621441.0,
"step": 218
},
{
"epoch": 2.777070063694268,
"grad_norm": 0.3366152346134186,
"learning_rate": 0.00013682349840755785,
"loss": 1.8193,
"mean_token_accuracy": 0.578848123550415,
"num_tokens": 11673397.0,
"step": 219
},
{
"epoch": 2.789808917197452,
"grad_norm": 0.3884471654891968,
"learning_rate": 0.00013627070832946718,
"loss": 1.8242,
"mean_token_accuracy": 0.5773838758468628,
"num_tokens": 11721935.0,
"step": 220
},
{
"epoch": 2.802547770700637,
"grad_norm": 0.34199899435043335,
"learning_rate": 0.00013571663903749984,
"loss": 1.8577,
"mean_token_accuracy": 0.5714328587055206,
"num_tokens": 11773734.0,
"step": 221
},
{
"epoch": 2.8152866242038215,
"grad_norm": 0.33372578024864197,
"learning_rate": 0.00013516131007285483,
"loss": 1.9038,
"mean_token_accuracy": 0.5661661624908447,
"num_tokens": 11827411.0,
"step": 222
},
{
"epoch": 2.8280254777070066,
"grad_norm": 0.35299476981163025,
"learning_rate": 0.00013460474102115785,
"loss": 1.9305,
"mean_token_accuracy": 0.5539820492267609,
"num_tokens": 11885042.0,
"step": 223
},
{
"epoch": 2.840764331210191,
"grad_norm": 0.3262571394443512,
"learning_rate": 0.0001340469515117706,
"loss": 1.8395,
"mean_token_accuracy": 0.5769472420215607,
"num_tokens": 11937750.0,
"step": 224
},
{
"epoch": 2.853503184713376,
"grad_norm": 0.3454640805721283,
"learning_rate": 0.00013348796121709862,
"loss": 1.9303,
"mean_token_accuracy": 0.5540551543235779,
"num_tokens": 11994353.0,
"step": 225
},
{
"epoch": 2.8662420382165603,
"grad_norm": 0.3303540349006653,
"learning_rate": 0.00013292778985189724,
"loss": 1.8883,
"mean_token_accuracy": 0.5732137262821198,
"num_tokens": 12045209.0,
"step": 226
},
{
"epoch": 2.8789808917197455,
"grad_norm": 0.33723363280296326,
"learning_rate": 0.0001323664571725764,
"loss": 1.8401,
"mean_token_accuracy": 0.5693773925304413,
"num_tokens": 12100118.0,
"step": 227
},
{
"epoch": 2.8917197452229297,
"grad_norm": 0.3337755799293518,
"learning_rate": 0.00013180398297650393,
"loss": 1.8682,
"mean_token_accuracy": 0.5703003406524658,
"num_tokens": 12151199.0,
"step": 228
},
{
"epoch": 2.904458598726115,
"grad_norm": 0.3465191125869751,
"learning_rate": 0.00013124038710130722,
"loss": 1.9025,
"mean_token_accuracy": 0.5660633742809296,
"num_tokens": 12204560.0,
"step": 229
},
{
"epoch": 2.917197452229299,
"grad_norm": 0.3397550582885742,
"learning_rate": 0.00013067568942417356,
"loss": 1.8608,
"mean_token_accuracy": 0.577092707157135,
"num_tokens": 12254931.0,
"step": 230
},
{
"epoch": 2.9299363057324843,
"grad_norm": 0.3317429721355438,
"learning_rate": 0.00013010990986114926,
"loss": 1.8107,
"mean_token_accuracy": 0.583151251077652,
"num_tokens": 12306585.0,
"step": 231
},
{
"epoch": 2.9426751592356686,
"grad_norm": 0.33635950088500977,
"learning_rate": 0.00012954306836643703,
"loss": 1.8137,
"mean_token_accuracy": 0.5811544060707092,
"num_tokens": 12356388.0,
"step": 232
},
{
"epoch": 2.9554140127388537,
"grad_norm": 0.31903377175331116,
"learning_rate": 0.0001289751849316924,
"loss": 1.853,
"mean_token_accuracy": 0.5772639214992523,
"num_tokens": 12411393.0,
"step": 233
},
{
"epoch": 2.968152866242038,
"grad_norm": 0.3346429169178009,
"learning_rate": 0.0001284062795853185,
"loss": 1.8567,
"mean_token_accuracy": 0.5724359452724457,
"num_tokens": 12463451.0,
"step": 234
},
{
"epoch": 2.980891719745223,
"grad_norm": 0.31035116314888,
"learning_rate": 0.00012783637239175994,
"loss": 1.8257,
"mean_token_accuracy": 0.5784881711006165,
"num_tokens": 12516374.0,
"step": 235
},
{
"epoch": 2.9936305732484074,
"grad_norm": 0.3308963179588318,
"learning_rate": 0.00012726548345079475,
"loss": 1.8253,
"mean_token_accuracy": 0.5765515863895416,
"num_tokens": 12566904.0,
"step": 236
},
{
"epoch": 3.0,
"grad_norm": 0.3308963179588318,
"learning_rate": 0.00012669363289682584,
"loss": 1.7624,
"mean_token_accuracy": 0.5832459330558777,
"num_tokens": 12594595.0,
"step": 237
},
{
"epoch": 3.0127388535031847,
"grad_norm": 0.5709105730056763,
"learning_rate": 0.0001261208408981708,
"loss": 1.5348,
"mean_token_accuracy": 0.6312867105007172,
"num_tokens": 12645317.0,
"step": 238
},
{
"epoch": 3.0254777070063694,
"grad_norm": 0.37340834736824036,
"learning_rate": 0.00012554712765635057,
"loss": 1.5576,
"mean_token_accuracy": 0.6242968440055847,
"num_tokens": 12695870.0,
"step": 239
},
{
"epoch": 3.038216560509554,
"grad_norm": 0.42538464069366455,
"learning_rate": 0.0001249725134053769,
"loss": 1.6086,
"mean_token_accuracy": 0.6167311370372772,
"num_tokens": 12748747.0,
"step": 240
},
{
"epoch": 3.050955414012739,
"grad_norm": 0.6033649444580078,
"learning_rate": 0.00012439701841103888,
"loss": 1.5902,
"mean_token_accuracy": 0.6181419789791107,
"num_tokens": 12800818.0,
"step": 241
},
{
"epoch": 3.0636942675159236,
"grad_norm": 0.47527989745140076,
"learning_rate": 0.00012382066297018804,
"loss": 1.5442,
"mean_token_accuracy": 0.6306857764720917,
"num_tokens": 12852337.0,
"step": 242
},
{
"epoch": 3.0764331210191083,
"grad_norm": 0.45292210578918457,
"learning_rate": 0.0001232434674100226,
"loss": 1.5734,
"mean_token_accuracy": 0.6232933402061462,
"num_tokens": 12904277.0,
"step": 243
},
{
"epoch": 3.089171974522293,
"grad_norm": 0.4075813591480255,
"learning_rate": 0.00012266545208737054,
"loss": 1.6569,
"mean_token_accuracy": 0.6056897044181824,
"num_tokens": 12960388.0,
"step": 244
},
{
"epoch": 3.1019108280254777,
"grad_norm": 0.4078131914138794,
"learning_rate": 0.00012208663738797165,
"loss": 1.6845,
"mean_token_accuracy": 0.5976538956165314,
"num_tokens": 13017128.0,
"step": 245
},
{
"epoch": 3.1146496815286624,
"grad_norm": 0.4596061110496521,
"learning_rate": 0.00012150704372575854,
"loss": 1.6204,
"mean_token_accuracy": 0.6098415553569794,
"num_tokens": 13073046.0,
"step": 246
},
{
"epoch": 3.127388535031847,
"grad_norm": 0.4180206060409546,
"learning_rate": 0.00012092669154213665,
"loss": 1.5515,
"mean_token_accuracy": 0.625440239906311,
"num_tokens": 13127890.0,
"step": 247
},
{
"epoch": 3.140127388535032,
"grad_norm": 0.4547070562839508,
"learning_rate": 0.0001203456013052634,
"loss": 1.5243,
"mean_token_accuracy": 0.6310254037380219,
"num_tokens": 13176907.0,
"step": 248
},
{
"epoch": 3.1528662420382165,
"grad_norm": 0.44779738783836365,
"learning_rate": 0.00011976379350932618,
"loss": 1.6406,
"mean_token_accuracy": 0.61042121052742,
"num_tokens": 13231296.0,
"step": 249
},
{
"epoch": 3.1656050955414012,
"grad_norm": 0.4205434024333954,
"learning_rate": 0.00011918128867381965,
"loss": 1.601,
"mean_token_accuracy": 0.6144575476646423,
"num_tokens": 13286944.0,
"step": 250
},
{
"epoch": 3.178343949044586,
"grad_norm": 0.4262813925743103,
"learning_rate": 0.00011859810734282208,
"loss": 1.6048,
"mean_token_accuracy": 0.6148422658443451,
"num_tokens": 13339138.0,
"step": 251
},
{
"epoch": 3.1910828025477707,
"grad_norm": 0.403509259223938,
"learning_rate": 0.00011801427008427063,
"loss": 1.6419,
"mean_token_accuracy": 0.6066917181015015,
"num_tokens": 13393964.0,
"step": 252
},
{
"epoch": 3.2038216560509554,
"grad_norm": 0.42821204662323,
"learning_rate": 0.00011742979748923611,
"loss": 1.5761,
"mean_token_accuracy": 0.6225632727146149,
"num_tokens": 13444462.0,
"step": 253
},
{
"epoch": 3.21656050955414,
"grad_norm": 0.4207237958908081,
"learning_rate": 0.00011684471017119667,
"loss": 1.6251,
"mean_token_accuracy": 0.6090623736381531,
"num_tokens": 13497905.0,
"step": 254
},
{
"epoch": 3.229299363057325,
"grad_norm": 0.435561865568161,
"learning_rate": 0.00011625902876531082,
"loss": 1.5851,
"mean_token_accuracy": 0.6203322112560272,
"num_tokens": 13549797.0,
"step": 255
},
{
"epoch": 3.2420382165605095,
"grad_norm": 0.42979681491851807,
"learning_rate": 0.00011567277392768972,
"loss": 1.6543,
"mean_token_accuracy": 0.5996465981006622,
"num_tokens": 13607702.0,
"step": 256
},
{
"epoch": 3.254777070063694,
"grad_norm": 0.417309433221817,
"learning_rate": 0.00011508596633466852,
"loss": 1.631,
"mean_token_accuracy": 0.6050024628639221,
"num_tokens": 13663975.0,
"step": 257
},
{
"epoch": 3.267515923566879,
"grad_norm": 0.42910832166671753,
"learning_rate": 0.00011449862668207734,
"loss": 1.5504,
"mean_token_accuracy": 0.6264341771602631,
"num_tokens": 13715134.0,
"step": 258
},
{
"epoch": 3.2802547770700636,
"grad_norm": 0.4290030002593994,
"learning_rate": 0.00011391077568451116,
"loss": 1.6161,
"mean_token_accuracy": 0.6089867949485779,
"num_tokens": 13770372.0,
"step": 259
},
{
"epoch": 3.2929936305732483,
"grad_norm": 0.4092896282672882,
"learning_rate": 0.0001133224340745994,
"loss": 1.6254,
"mean_token_accuracy": 0.6103326678276062,
"num_tokens": 13824982.0,
"step": 260
},
{
"epoch": 3.305732484076433,
"grad_norm": 0.4829498529434204,
"learning_rate": 0.00011273362260227458,
"loss": 1.6772,
"mean_token_accuracy": 0.5996585786342621,
"num_tokens": 13878634.0,
"step": 261
},
{
"epoch": 3.3184713375796178,
"grad_norm": 0.42151686549186707,
"learning_rate": 0.00011214436203404062,
"loss": 1.6424,
"mean_token_accuracy": 0.6086190938949585,
"num_tokens": 13932699.0,
"step": 262
},
{
"epoch": 3.3312101910828025,
"grad_norm": 0.47397086024284363,
"learning_rate": 0.00011155467315224038,
"loss": 1.5956,
"mean_token_accuracy": 0.6170568764209747,
"num_tokens": 13987390.0,
"step": 263
},
{
"epoch": 3.343949044585987,
"grad_norm": 0.46223410964012146,
"learning_rate": 0.00011096457675432266,
"loss": 1.5429,
"mean_token_accuracy": 0.6272397041320801,
"num_tokens": 14042217.0,
"step": 264
},
{
"epoch": 3.356687898089172,
"grad_norm": 0.45418688654899597,
"learning_rate": 0.0001103740936521088,
"loss": 1.587,
"mean_token_accuracy": 0.6170405745506287,
"num_tokens": 14097146.0,
"step": 265
},
{
"epoch": 3.3694267515923566,
"grad_norm": 0.451417475938797,
"learning_rate": 0.00010978324467105858,
"loss": 1.5889,
"mean_token_accuracy": 0.6181528270244598,
"num_tokens": 14150140.0,
"step": 266
},
{
"epoch": 3.3821656050955413,
"grad_norm": 0.4451967477798462,
"learning_rate": 0.00010919205064953582,
"loss": 1.6392,
"mean_token_accuracy": 0.6059041917324066,
"num_tokens": 14203411.0,
"step": 267
},
{
"epoch": 3.394904458598726,
"grad_norm": 0.45706379413604736,
"learning_rate": 0.00010860053243807338,
"loss": 1.5662,
"mean_token_accuracy": 0.6224644184112549,
"num_tokens": 14255594.0,
"step": 268
},
{
"epoch": 3.4076433121019107,
"grad_norm": 0.4251766502857208,
"learning_rate": 0.00010800871089863785,
"loss": 1.6594,
"mean_token_accuracy": 0.6004246771335602,
"num_tokens": 14309453.0,
"step": 269
},
{
"epoch": 3.4203821656050954,
"grad_norm": 0.43268513679504395,
"learning_rate": 0.00010741660690389365,
"loss": 1.6486,
"mean_token_accuracy": 0.60761758685112,
"num_tokens": 14362531.0,
"step": 270
},
{
"epoch": 3.43312101910828,
"grad_norm": 0.4630923271179199,
"learning_rate": 0.0001068242413364671,
"loss": 1.6296,
"mean_token_accuracy": 0.6059266030788422,
"num_tokens": 14416899.0,
"step": 271
},
{
"epoch": 3.445859872611465,
"grad_norm": 0.44578132033348083,
"learning_rate": 0.00010623163508820977,
"loss": 1.5702,
"mean_token_accuracy": 0.6231890618801117,
"num_tokens": 14467276.0,
"step": 272
},
{
"epoch": 3.4585987261146496,
"grad_norm": 0.4357207119464874,
"learning_rate": 0.00010563880905946159,
"loss": 1.6422,
"mean_token_accuracy": 0.6079367101192474,
"num_tokens": 14520632.0,
"step": 273
},
{
"epoch": 3.4713375796178343,
"grad_norm": 0.45229652523994446,
"learning_rate": 0.00010504578415831395,
"loss": 1.5766,
"mean_token_accuracy": 0.6189067661762238,
"num_tokens": 14573666.0,
"step": 274
},
{
"epoch": 3.484076433121019,
"grad_norm": 0.4296993017196655,
"learning_rate": 0.00010445258129987206,
"loss": 1.6185,
"mean_token_accuracy": 0.6093391180038452,
"num_tokens": 14628510.0,
"step": 275
},
{
"epoch": 3.4968152866242037,
"grad_norm": 0.4645271897315979,
"learning_rate": 0.00010385922140551752,
"loss": 1.6316,
"mean_token_accuracy": 0.6081016957759857,
"num_tokens": 14680839.0,
"step": 276
},
{
"epoch": 3.5095541401273884,
"grad_norm": 0.4231947660446167,
"learning_rate": 0.00010326572540217028,
"loss": 1.5685,
"mean_token_accuracy": 0.6181470155715942,
"num_tokens": 14734284.0,
"step": 277
},
{
"epoch": 3.522292993630573,
"grad_norm": 0.45970481634140015,
"learning_rate": 0.00010267211422155072,
"loss": 1.689,
"mean_token_accuracy": 0.5970478057861328,
"num_tokens": 14789749.0,
"step": 278
},
{
"epoch": 3.535031847133758,
"grad_norm": 0.45939549803733826,
"learning_rate": 0.00010207840879944123,
"loss": 1.657,
"mean_token_accuracy": 0.6039794981479645,
"num_tokens": 14844791.0,
"step": 279
},
{
"epoch": 3.5477707006369426,
"grad_norm": 0.4448122978210449,
"learning_rate": 0.0001014846300749481,
"loss": 1.5795,
"mean_token_accuracy": 0.6173191368579865,
"num_tokens": 14899936.0,
"step": 280
},
{
"epoch": 3.5605095541401273,
"grad_norm": 0.45363184809684753,
"learning_rate": 0.00010089079898976284,
"loss": 1.6463,
"mean_token_accuracy": 0.606724739074707,
"num_tokens": 14951801.0,
"step": 281
},
{
"epoch": 3.573248407643312,
"grad_norm": 0.4669179916381836,
"learning_rate": 0.00010029693648742355,
"loss": 1.5501,
"mean_token_accuracy": 0.6252025663852692,
"num_tokens": 15003466.0,
"step": 282
},
{
"epoch": 3.5859872611464967,
"grad_norm": 0.4588845372200012,
"learning_rate": 9.970306351257647e-05,
"loss": 1.5634,
"mean_token_accuracy": 0.6214375197887421,
"num_tokens": 15053985.0,
"step": 283
},
{
"epoch": 3.5987261146496814,
"grad_norm": 0.4477427303791046,
"learning_rate": 9.910920101023717e-05,
"loss": 1.5378,
"mean_token_accuracy": 0.6221558153629303,
"num_tokens": 15106417.0,
"step": 284
},
{
"epoch": 3.611464968152866,
"grad_norm": 0.46768298745155334,
"learning_rate": 9.851536992505188e-05,
"loss": 1.6178,
"mean_token_accuracy": 0.6068744659423828,
"num_tokens": 15160298.0,
"step": 285
},
{
"epoch": 3.624203821656051,
"grad_norm": 0.4312836825847626,
"learning_rate": 9.79215912005588e-05,
"loss": 1.6021,
"mean_token_accuracy": 0.6140561103820801,
"num_tokens": 15212466.0,
"step": 286
},
{
"epoch": 3.6369426751592355,
"grad_norm": 0.44851383566856384,
"learning_rate": 9.732788577844934e-05,
"loss": 1.6538,
"mean_token_accuracy": 0.6001670658588409,
"num_tokens": 15265693.0,
"step": 287
},
{
"epoch": 3.6496815286624202,
"grad_norm": 0.4596638083457947,
"learning_rate": 9.673427459782974e-05,
"loss": 1.599,
"mean_token_accuracy": 0.6147986352443695,
"num_tokens": 15319305.0,
"step": 288
},
{
"epoch": 3.662420382165605,
"grad_norm": 0.4196668565273285,
"learning_rate": 9.61407785944825e-05,
"loss": 1.612,
"mean_token_accuracy": 0.6101915836334229,
"num_tokens": 15373229.0,
"step": 289
},
{
"epoch": 3.6751592356687897,
"grad_norm": 0.4389522075653076,
"learning_rate": 9.554741870012797e-05,
"loss": 1.6116,
"mean_token_accuracy": 0.6180192828178406,
"num_tokens": 15424052.0,
"step": 290
},
{
"epoch": 3.6878980891719744,
"grad_norm": 0.4534909129142761,
"learning_rate": 9.495421584168609e-05,
"loss": 1.5581,
"mean_token_accuracy": 0.6236461997032166,
"num_tokens": 15477522.0,
"step": 291
},
{
"epoch": 3.700636942675159,
"grad_norm": 0.4369897246360779,
"learning_rate": 9.436119094053846e-05,
"loss": 1.5265,
"mean_token_accuracy": 0.6339597702026367,
"num_tokens": 15526462.0,
"step": 292
},
{
"epoch": 3.713375796178344,
"grad_norm": 0.437324196100235,
"learning_rate": 9.376836491179028e-05,
"loss": 1.6315,
"mean_token_accuracy": 0.612496554851532,
"num_tokens": 15580253.0,
"step": 293
},
{
"epoch": 3.7261146496815285,
"grad_norm": 0.4279663562774658,
"learning_rate": 9.317575866353292e-05,
"loss": 1.6586,
"mean_token_accuracy": 0.602456271648407,
"num_tokens": 15634968.0,
"step": 294
},
{
"epoch": 3.738853503184713,
"grad_norm": 0.44840502738952637,
"learning_rate": 9.258339309610637e-05,
"loss": 1.5754,
"mean_token_accuracy": 0.621392697095871,
"num_tokens": 15685372.0,
"step": 295
},
{
"epoch": 3.7515923566878984,
"grad_norm": 0.43560630083084106,
"learning_rate": 9.199128910136219e-05,
"loss": 1.6192,
"mean_token_accuracy": 0.6109454035758972,
"num_tokens": 15740582.0,
"step": 296
},
{
"epoch": 3.7643312101910826,
"grad_norm": 0.43762698769569397,
"learning_rate": 9.139946756192663e-05,
"loss": 1.6574,
"mean_token_accuracy": 0.6039230525493622,
"num_tokens": 15795625.0,
"step": 297
},
{
"epoch": 3.777070063694268,
"grad_norm": 0.4506418704986572,
"learning_rate": 9.080794935046421e-05,
"loss": 1.7151,
"mean_token_accuracy": 0.5921238660812378,
"num_tokens": 15851160.0,
"step": 298
},
{
"epoch": 3.789808917197452,
"grad_norm": 0.4315105974674225,
"learning_rate": 9.021675532894145e-05,
"loss": 1.6071,
"mean_token_accuracy": 0.6140862107276917,
"num_tokens": 15905320.0,
"step": 299
},
{
"epoch": 3.802547770700637,
"grad_norm": 0.42772069573402405,
"learning_rate": 8.962590634789123e-05,
"loss": 1.5918,
"mean_token_accuracy": 0.6131418347358704,
"num_tokens": 15958430.0,
"step": 300
},
{
"epoch": 3.8152866242038215,
"grad_norm": 0.4342682957649231,
"learning_rate": 8.903542324567736e-05,
"loss": 1.6069,
"mean_token_accuracy": 0.612420380115509,
"num_tokens": 16011686.0,
"step": 301
},
{
"epoch": 3.8280254777070066,
"grad_norm": 0.4235387146472931,
"learning_rate": 8.844532684775963e-05,
"loss": 1.5833,
"mean_token_accuracy": 0.6175683438777924,
"num_tokens": 16065791.0,
"step": 302
},
{
"epoch": 3.840764331210191,
"grad_norm": 0.4537542462348938,
"learning_rate": 8.785563796595938e-05,
"loss": 1.5187,
"mean_token_accuracy": 0.6387709379196167,
"num_tokens": 16118281.0,
"step": 303
},
{
"epoch": 3.853503184713376,
"grad_norm": 0.4140053391456604,
"learning_rate": 8.726637739772542e-05,
"loss": 1.5997,
"mean_token_accuracy": 0.6152973771095276,
"num_tokens": 16171205.0,
"step": 304
},
{
"epoch": 3.8662420382165603,
"grad_norm": 0.43215644359588623,
"learning_rate": 8.667756592540064e-05,
"loss": 1.5819,
"mean_token_accuracy": 0.6192367970943451,
"num_tokens": 16226137.0,
"step": 305
},
{
"epoch": 3.8789808917197455,
"grad_norm": 0.43919017910957336,
"learning_rate": 8.608922431548887e-05,
"loss": 1.6109,
"mean_token_accuracy": 0.6121656596660614,
"num_tokens": 16280969.0,
"step": 306
},
{
"epoch": 3.8917197452229297,
"grad_norm": 0.46311888098716736,
"learning_rate": 8.55013733179227e-05,
"loss": 1.6064,
"mean_token_accuracy": 0.6149270236492157,
"num_tokens": 16333220.0,
"step": 307
},
{
"epoch": 3.904458598726115,
"grad_norm": 0.43454501032829285,
"learning_rate": 8.49140336653315e-05,
"loss": 1.5255,
"mean_token_accuracy": 0.6324739158153534,
"num_tokens": 16387242.0,
"step": 308
},
{
"epoch": 3.917197452229299,
"grad_norm": 0.42468395829200745,
"learning_rate": 8.43272260723103e-05,
"loss": 1.6324,
"mean_token_accuracy": 0.6103453934192657,
"num_tokens": 16440644.0,
"step": 309
},
{
"epoch": 3.9299363057324843,
"grad_norm": 0.42441028356552124,
"learning_rate": 8.374097123468918e-05,
"loss": 1.7077,
"mean_token_accuracy": 0.5908953249454498,
"num_tokens": 16497832.0,
"step": 310
},
{
"epoch": 3.9426751592356686,
"grad_norm": 0.4248032867908478,
"learning_rate": 8.315528982880337e-05,
"loss": 1.5252,
"mean_token_accuracy": 0.630544900894165,
"num_tokens": 16550056.0,
"step": 311
},
{
"epoch": 3.9554140127388537,
"grad_norm": 0.4091551601886749,
"learning_rate": 8.257020251076393e-05,
"loss": 1.7251,
"mean_token_accuracy": 0.5953080356121063,
"num_tokens": 16604770.0,
"step": 312
},
{
"epoch": 3.968152866242038,
"grad_norm": 0.4335462152957916,
"learning_rate": 8.198572991572939e-05,
"loss": 1.5564,
"mean_token_accuracy": 0.6247545778751373,
"num_tokens": 16656307.0,
"step": 313
},
{
"epoch": 3.980891719745223,
"grad_norm": 0.4381133019924164,
"learning_rate": 8.140189265717794e-05,
"loss": 1.697,
"mean_token_accuracy": 0.5903680324554443,
"num_tokens": 16712946.0,
"step": 314
},
{
"epoch": 3.9936305732484074,
"grad_norm": 0.4349663257598877,
"learning_rate": 8.081871132618036e-05,
"loss": 1.5864,
"mean_token_accuracy": 0.6181161403656006,
"num_tokens": 16766918.0,
"step": 315
},
{
"epoch": 4.0,
"grad_norm": 0.710847795009613,
"learning_rate": 8.023620649067384e-05,
"loss": 1.3252,
"mean_token_accuracy": 0.673402726650238,
"num_tokens": 16791742.0,
"step": 316
},
{
"epoch": 4.012738853503185,
"grad_norm": 0.5439519882202148,
"learning_rate": 7.965439869473664e-05,
"loss": 1.3862,
"mean_token_accuracy": 0.6603533327579498,
"num_tokens": 16845599.0,
"step": 317
},
{
"epoch": 4.025477707006369,
"grad_norm": 0.5056113004684448,
"learning_rate": 7.907330845786337e-05,
"loss": 1.3117,
"mean_token_accuracy": 0.6728927791118622,
"num_tokens": 16903029.0,
"step": 318
},
{
"epoch": 4.038216560509555,
"grad_norm": 0.6413962841033936,
"learning_rate": 7.849295627424148e-05,
"loss": 1.2577,
"mean_token_accuracy": 0.6805729269981384,
"num_tokens": 16956656.0,
"step": 319
},
{
"epoch": 4.050955414012739,
"grad_norm": 0.899278461933136,
"learning_rate": 7.791336261202835e-05,
"loss": 1.4156,
"mean_token_accuracy": 0.6467656791210175,
"num_tokens": 17014671.0,
"step": 320
},
{
"epoch": 4.063694267515924,
"grad_norm": 0.6237316727638245,
"learning_rate": 7.733454791262947e-05,
"loss": 1.3492,
"mean_token_accuracy": 0.6739301681518555,
"num_tokens": 17067978.0,
"step": 321
},
{
"epoch": 4.076433121019108,
"grad_norm": 0.5638516545295715,
"learning_rate": 7.67565325899774e-05,
"loss": 1.3656,
"mean_token_accuracy": 0.6638805568218231,
"num_tokens": 17121757.0,
"step": 322
},
{
"epoch": 4.089171974522293,
"grad_norm": 0.5784188508987427,
"learning_rate": 7.617933702981198e-05,
"loss": 1.3717,
"mean_token_accuracy": 0.6573343873023987,
"num_tokens": 17173561.0,
"step": 323
},
{
"epoch": 4.101910828025478,
"grad_norm": 0.5291357040405273,
"learning_rate": 7.560298158896114e-05,
"loss": 1.3286,
"mean_token_accuracy": 0.6641911864280701,
"num_tokens": 17227738.0,
"step": 324
},
{
"epoch": 4.114649681528663,
"grad_norm": 0.5891243815422058,
"learning_rate": 7.502748659462311e-05,
"loss": 1.3093,
"mean_token_accuracy": 0.6751121878623962,
"num_tokens": 17277389.0,
"step": 325
},
{
"epoch": 4.127388535031847,
"grad_norm": 0.6397759914398193,
"learning_rate": 7.445287234364946e-05,
"loss": 1.355,
"mean_token_accuracy": 0.6581599414348602,
"num_tokens": 17333692.0,
"step": 326
},
{
"epoch": 4.140127388535032,
"grad_norm": 0.6335495710372925,
"learning_rate": 7.38791591018292e-05,
"loss": 1.2835,
"mean_token_accuracy": 0.6767120361328125,
"num_tokens": 17385957.0,
"step": 327
},
{
"epoch": 4.1528662420382165,
"grad_norm": 0.5888403654098511,
"learning_rate": 7.330636710317417e-05,
"loss": 1.3085,
"mean_token_accuracy": 0.6664162874221802,
"num_tokens": 17444104.0,
"step": 328
},
{
"epoch": 4.165605095541402,
"grad_norm": 0.5644891858100891,
"learning_rate": 7.273451654920532e-05,
"loss": 1.3947,
"mean_token_accuracy": 0.650380402803421,
"num_tokens": 17502810.0,
"step": 329
},
{
"epoch": 4.178343949044586,
"grad_norm": 0.5841726064682007,
"learning_rate": 7.21636276082401e-05,
"loss": 1.2907,
"mean_token_accuracy": 0.6746163070201874,
"num_tokens": 17555488.0,
"step": 330
},
{
"epoch": 4.191082802547771,
"grad_norm": 0.5533628463745117,
"learning_rate": 7.15937204146815e-05,
"loss": 1.3046,
"mean_token_accuracy": 0.6744789183139801,
"num_tokens": 17610233.0,
"step": 331
},
{
"epoch": 4.203821656050955,
"grad_norm": 0.5649828910827637,
"learning_rate": 7.102481506830764e-05,
"loss": 1.228,
"mean_token_accuracy": 0.693218320608139,
"num_tokens": 17662910.0,
"step": 332
},
{
"epoch": 4.2165605095541405,
"grad_norm": 0.5603880882263184,
"learning_rate": 7.0456931633563e-05,
"loss": 1.2269,
"mean_token_accuracy": 0.6878877878189087,
"num_tokens": 17715135.0,
"step": 333
},
{
"epoch": 4.229299363057325,
"grad_norm": 0.5503774881362915,
"learning_rate": 6.989009013885077e-05,
"loss": 1.2708,
"mean_token_accuracy": 0.6807169020175934,
"num_tokens": 17767413.0,
"step": 334
},
{
"epoch": 4.24203821656051,
"grad_norm": 0.5674378275871277,
"learning_rate": 6.932431057582647e-05,
"loss": 1.3011,
"mean_token_accuracy": 0.6756401658058167,
"num_tokens": 17822708.0,
"step": 335
},
{
"epoch": 4.254777070063694,
"grad_norm": 0.5780754685401917,
"learning_rate": 6.875961289869283e-05,
"loss": 1.3628,
"mean_token_accuracy": 0.656164288520813,
"num_tokens": 17874618.0,
"step": 336
},
{
"epoch": 4.267515923566879,
"grad_norm": 0.5727635025978088,
"learning_rate": 6.819601702349609e-05,
"loss": 1.2003,
"mean_token_accuracy": 0.6980417370796204,
"num_tokens": 17928242.0,
"step": 337
},
{
"epoch": 4.280254777070064,
"grad_norm": 0.5978534817695618,
"learning_rate": 6.763354282742363e-05,
"loss": 1.3634,
"mean_token_accuracy": 0.6629419326782227,
"num_tokens": 17983335.0,
"step": 338
},
{
"epoch": 4.292993630573249,
"grad_norm": 0.5879784822463989,
"learning_rate": 6.707221014810279e-05,
"loss": 1.3021,
"mean_token_accuracy": 0.6740579605102539,
"num_tokens": 18035861.0,
"step": 339
},
{
"epoch": 4.305732484076433,
"grad_norm": 0.5777925848960876,
"learning_rate": 6.651203878290139e-05,
"loss": 1.4033,
"mean_token_accuracy": 0.6527241766452789,
"num_tokens": 18089211.0,
"step": 340
},
{
"epoch": 4.318471337579618,
"grad_norm": 0.5422646403312683,
"learning_rate": 6.59530484882294e-05,
"loss": 1.3524,
"mean_token_accuracy": 0.662738710641861,
"num_tokens": 18145588.0,
"step": 341
},
{
"epoch": 4.3312101910828025,
"grad_norm": 0.5661242008209229,
"learning_rate": 6.539525897884219e-05,
"loss": 1.2663,
"mean_token_accuracy": 0.6824060380458832,
"num_tokens": 18195902.0,
"step": 342
},
{
"epoch": 4.343949044585988,
"grad_norm": 0.5987046957015991,
"learning_rate": 6.48386899271452e-05,
"loss": 1.3167,
"mean_token_accuracy": 0.6675301194190979,
"num_tokens": 18246257.0,
"step": 343
},
{
"epoch": 4.356687898089172,
"grad_norm": 0.5884360074996948,
"learning_rate": 6.428336096250019e-05,
"loss": 1.2387,
"mean_token_accuracy": 0.6884565055370331,
"num_tokens": 18295900.0,
"step": 344
},
{
"epoch": 4.369426751592357,
"grad_norm": 0.5758609771728516,
"learning_rate": 6.372929167053286e-05,
"loss": 1.3223,
"mean_token_accuracy": 0.6655027866363525,
"num_tokens": 18350010.0,
"step": 345
},
{
"epoch": 4.382165605095541,
"grad_norm": 0.5874727368354797,
"learning_rate": 6.317650159244212e-05,
"loss": 1.3319,
"mean_token_accuracy": 0.6696738302707672,
"num_tokens": 18402566.0,
"step": 346
},
{
"epoch": 4.3949044585987265,
"grad_norm": 0.6059537529945374,
"learning_rate": 6.2625010224311e-05,
"loss": 1.2889,
"mean_token_accuracy": 0.6799558997154236,
"num_tokens": 18454978.0,
"step": 347
},
{
"epoch": 4.407643312101911,
"grad_norm": 0.586950957775116,
"learning_rate": 6.207483701641888e-05,
"loss": 1.309,
"mean_token_accuracy": 0.673223465681076,
"num_tokens": 18506541.0,
"step": 348
},
{
"epoch": 4.420382165605096,
"grad_norm": 0.5819146037101746,
"learning_rate": 6.15260013725555e-05,
"loss": 1.3644,
"mean_token_accuracy": 0.6632392704486847,
"num_tokens": 18557931.0,
"step": 349
},
{
"epoch": 4.43312101910828,
"grad_norm": 0.5691138505935669,
"learning_rate": 6.097852264933697e-05,
"loss": 1.386,
"mean_token_accuracy": 0.6523266136646271,
"num_tokens": 18613153.0,
"step": 350
},
{
"epoch": 4.445859872611465,
"grad_norm": 0.5579886436462402,
"learning_rate": 6.043242015552258e-05,
"loss": 1.3543,
"mean_token_accuracy": 0.660747766494751,
"num_tokens": 18666337.0,
"step": 351
},
{
"epoch": 4.45859872611465,
"grad_norm": 0.5413755178451538,
"learning_rate": 5.988771315133418e-05,
"loss": 1.4394,
"mean_token_accuracy": 0.64309361577034,
"num_tokens": 18722640.0,
"step": 352
},
{
"epoch": 4.471337579617835,
"grad_norm": 0.5620366930961609,
"learning_rate": 5.934442084777676e-05,
"loss": 1.3786,
"mean_token_accuracy": 0.6538053452968597,
"num_tokens": 18778298.0,
"step": 353
},
{
"epoch": 4.484076433121019,
"grad_norm": 0.5585454106330872,
"learning_rate": 5.880256240596096e-05,
"loss": 1.2928,
"mean_token_accuracy": 0.6763462126255035,
"num_tokens": 18831628.0,
"step": 354
},
{
"epoch": 4.496815286624204,
"grad_norm": 0.5773540139198303,
"learning_rate": 5.8262156936427096e-05,
"loss": 1.3325,
"mean_token_accuracy": 0.6678478717803955,
"num_tokens": 18883919.0,
"step": 355
},
{
"epoch": 4.509554140127388,
"grad_norm": 0.5874897837638855,
"learning_rate": 5.772322349847154e-05,
"loss": 1.3506,
"mean_token_accuracy": 0.6611494421958923,
"num_tokens": 18940158.0,
"step": 356
},
{
"epoch": 4.522292993630574,
"grad_norm": 0.5982579588890076,
"learning_rate": 5.71857810994741e-05,
"loss": 1.2726,
"mean_token_accuracy": 0.6766319572925568,
"num_tokens": 18990223.0,
"step": 357
},
{
"epoch": 4.535031847133758,
"grad_norm": 0.5581091046333313,
"learning_rate": 5.6649848694228026e-05,
"loss": 1.3535,
"mean_token_accuracy": 0.6625830829143524,
"num_tokens": 19045126.0,
"step": 358
},
{
"epoch": 4.547770700636943,
"grad_norm": 0.5802775025367737,
"learning_rate": 5.611544518427121e-05,
"loss": 1.2707,
"mean_token_accuracy": 0.6781118214130402,
"num_tokens": 19094650.0,
"step": 359
},
{
"epoch": 4.560509554140127,
"grad_norm": 0.5925814509391785,
"learning_rate": 5.558258941721982e-05,
"loss": 1.3001,
"mean_token_accuracy": 0.6749387383460999,
"num_tokens": 19146493.0,
"step": 360
},
{
"epoch": 4.573248407643312,
"grad_norm": 0.5560547709465027,
"learning_rate": 5.5051300186103214e-05,
"loss": 1.3444,
"mean_token_accuracy": 0.6658226251602173,
"num_tokens": 19200056.0,
"step": 361
},
{
"epoch": 4.585987261146497,
"grad_norm": 0.5550312995910645,
"learning_rate": 5.452159622870158e-05,
"loss": 1.2867,
"mean_token_accuracy": 0.6791023910045624,
"num_tokens": 19254330.0,
"step": 362
},
{
"epoch": 4.598726114649682,
"grad_norm": 0.5698755383491516,
"learning_rate": 5.399349622688479e-05,
"loss": 1.3115,
"mean_token_accuracy": 0.6727179288864136,
"num_tokens": 19308203.0,
"step": 363
},
{
"epoch": 4.611464968152866,
"grad_norm": 0.5808539986610413,
"learning_rate": 5.346701880595354e-05,
"loss": 1.25,
"mean_token_accuracy": 0.6817833781242371,
"num_tokens": 19360505.0,
"step": 364
},
{
"epoch": 4.624203821656051,
"grad_norm": 0.5801878571510315,
"learning_rate": 5.29421825339826e-05,
"loss": 1.3489,
"mean_token_accuracy": 0.6604253947734833,
"num_tokens": 19415107.0,
"step": 365
},
{
"epoch": 4.6369426751592355,
"grad_norm": 0.562362551689148,
"learning_rate": 5.24190059211658e-05,
"loss": 1.2972,
"mean_token_accuracy": 0.6697467267513275,
"num_tokens": 19471390.0,
"step": 366
},
{
"epoch": 4.649681528662421,
"grad_norm": 0.5844375491142273,
"learning_rate": 5.189750741916326e-05,
"loss": 1.2506,
"mean_token_accuracy": 0.6850372850894928,
"num_tokens": 19524341.0,
"step": 367
},
{
"epoch": 4.662420382165605,
"grad_norm": 0.583635151386261,
"learning_rate": 5.137770542045063e-05,
"loss": 1.3336,
"mean_token_accuracy": 0.6662910580635071,
"num_tokens": 19579112.0,
"step": 368
},
{
"epoch": 4.67515923566879,
"grad_norm": 0.5848417282104492,
"learning_rate": 5.085961825767049e-05,
"loss": 1.3237,
"mean_token_accuracy": 0.6704005897045135,
"num_tokens": 19629515.0,
"step": 369
},
{
"epoch": 4.687898089171974,
"grad_norm": 0.5747386813163757,
"learning_rate": 5.0343264202985575e-05,
"loss": 1.3051,
"mean_token_accuracy": 0.67464280128479,
"num_tokens": 19683814.0,
"step": 370
},
{
"epoch": 4.7006369426751595,
"grad_norm": 0.5863603949546814,
"learning_rate": 4.9828661467434644e-05,
"loss": 1.3308,
"mean_token_accuracy": 0.666056215763092,
"num_tokens": 19737421.0,
"step": 371
},
{
"epoch": 4.713375796178344,
"grad_norm": 0.5642786026000977,
"learning_rate": 4.93158282002899e-05,
"loss": 1.3423,
"mean_token_accuracy": 0.6685330271720886,
"num_tokens": 19789487.0,
"step": 372
},
{
"epoch": 4.726114649681529,
"grad_norm": 0.5639926195144653,
"learning_rate": 4.8804782488417054e-05,
"loss": 1.3475,
"mean_token_accuracy": 0.66647008061409,
"num_tokens": 19845546.0,
"step": 373
},
{
"epoch": 4.738853503184713,
"grad_norm": 0.5656535029411316,
"learning_rate": 4.82955423556375e-05,
"loss": 1.2665,
"mean_token_accuracy": 0.6775676608085632,
"num_tokens": 19899824.0,
"step": 374
},
{
"epoch": 4.751592356687898,
"grad_norm": 0.586066722869873,
"learning_rate": 4.778812576209241e-05,
"loss": 1.2878,
"mean_token_accuracy": 0.674250066280365,
"num_tokens": 19953139.0,
"step": 375
},
{
"epoch": 4.764331210191083,
"grad_norm": 0.5745534896850586,
"learning_rate": 4.728255060360955e-05,
"loss": 1.3091,
"mean_token_accuracy": 0.6695550978183746,
"num_tokens": 20005717.0,
"step": 376
},
{
"epoch": 4.777070063694268,
"grad_norm": 0.5694602727890015,
"learning_rate": 4.677883471107193e-05,
"loss": 1.3747,
"mean_token_accuracy": 0.6596313714981079,
"num_tokens": 20061075.0,
"step": 377
},
{
"epoch": 4.789808917197452,
"grad_norm": 0.567896842956543,
"learning_rate": 4.6276995849789115e-05,
"loss": 1.3263,
"mean_token_accuracy": 0.6638911068439484,
"num_tokens": 20115574.0,
"step": 378
},
{
"epoch": 4.802547770700637,
"grad_norm": 0.5845338106155396,
"learning_rate": 4.57770517188705e-05,
"loss": 1.3937,
"mean_token_accuracy": 0.6563752293586731,
"num_tokens": 20166843.0,
"step": 379
},
{
"epoch": 4.8152866242038215,
"grad_norm": 0.5952852964401245,
"learning_rate": 4.527901995060113e-05,
"loss": 1.346,
"mean_token_accuracy": 0.663836270570755,
"num_tokens": 20218952.0,
"step": 380
},
{
"epoch": 4.828025477707007,
"grad_norm": 0.558334469795227,
"learning_rate": 4.478291810981998e-05,
"loss": 1.3504,
"mean_token_accuracy": 0.6601009964942932,
"num_tokens": 20277206.0,
"step": 381
},
{
"epoch": 4.840764331210191,
"grad_norm": 0.579488217830658,
"learning_rate": 4.428876369330023e-05,
"loss": 1.3571,
"mean_token_accuracy": 0.6619445979595184,
"num_tokens": 20332638.0,
"step": 382
},
{
"epoch": 4.853503184713376,
"grad_norm": 0.5898194909095764,
"learning_rate": 4.379657412913243e-05,
"loss": 1.3128,
"mean_token_accuracy": 0.6692111194133759,
"num_tokens": 20387400.0,
"step": 383
},
{
"epoch": 4.86624203821656,
"grad_norm": 0.5899797677993774,
"learning_rate": 4.330636677610962e-05,
"loss": 1.3015,
"mean_token_accuracy": 0.6716260015964508,
"num_tokens": 20437836.0,
"step": 384
},
{
"epoch": 4.8789808917197455,
"grad_norm": 0.5910171270370483,
"learning_rate": 4.281815892311525e-05,
"loss": 1.3263,
"mean_token_accuracy": 0.6681764125823975,
"num_tokens": 20491880.0,
"step": 385
},
{
"epoch": 4.89171974522293,
"grad_norm": 0.5859639644622803,
"learning_rate": 4.2331967788513295e-05,
"loss": 1.2936,
"mean_token_accuracy": 0.674592137336731,
"num_tokens": 20545299.0,
"step": 386
},
{
"epoch": 4.904458598726115,
"grad_norm": 0.5616726279258728,
"learning_rate": 4.1847810519541255e-05,
"loss": 1.2783,
"mean_token_accuracy": 0.6760396957397461,
"num_tokens": 20597092.0,
"step": 387
},
{
"epoch": 4.917197452229299,
"grad_norm": 0.585740864276886,
"learning_rate": 4.136570419170501e-05,
"loss": 1.2801,
"mean_token_accuracy": 0.6786915361881256,
"num_tokens": 20648729.0,
"step": 388
},
{
"epoch": 4.929936305732484,
"grad_norm": 0.5653679370880127,
"learning_rate": 4.088566580817694e-05,
"loss": 1.277,
"mean_token_accuracy": 0.6827846765518188,
"num_tokens": 20700814.0,
"step": 389
},
{
"epoch": 4.942675159235669,
"grad_norm": 0.55994713306427,
"learning_rate": 4.040771229919612e-05,
"loss": 1.3656,
"mean_token_accuracy": 0.6609182953834534,
"num_tokens": 20757340.0,
"step": 390
},
{
"epoch": 4.955414012738854,
"grad_norm": 0.5757020115852356,
"learning_rate": 3.99318605214711e-05,
"loss": 1.3236,
"mean_token_accuracy": 0.6677860915660858,
"num_tokens": 20810088.0,
"step": 391
},
{
"epoch": 4.968152866242038,
"grad_norm": 0.5951821208000183,
"learning_rate": 3.945812725758554e-05,
"loss": 1.1905,
"mean_token_accuracy": 0.6992946565151215,
"num_tokens": 20857926.0,
"step": 392
},
{
"epoch": 4.980891719745223,
"grad_norm": 0.5893043875694275,
"learning_rate": 3.8986529215406275e-05,
"loss": 1.3325,
"mean_token_accuracy": 0.6695416867733002,
"num_tokens": 20913912.0,
"step": 393
},
{
"epoch": 4.993630573248407,
"grad_norm": 0.5932007431983948,
"learning_rate": 3.851708302749409e-05,
"loss": 1.347,
"mean_token_accuracy": 0.6626794338226318,
"num_tokens": 20964604.0,
"step": 394
},
{
"epoch": 5.0,
"grad_norm": 0.5932007431983948,
"learning_rate": 3.8049805250517004e-05,
"loss": 1.1922,
"mean_token_accuracy": 0.6985917687416077,
"num_tokens": 20990342.0,
"step": 395
},
{
"epoch": 5.012738853503185,
"grad_norm": 0.949424684047699,
"learning_rate": 3.7584712364666494e-05,
"loss": 1.0667,
"mean_token_accuracy": 0.7288348972797394,
"num_tokens": 21043351.0,
"step": 396
},
{
"epoch": 5.025477707006369,
"grad_norm": 0.6719571948051453,
"learning_rate": 3.71218207730761e-05,
"loss": 1.0423,
"mean_token_accuracy": 0.7332281470298767,
"num_tokens": 21099798.0,
"step": 397
},
{
"epoch": 5.038216560509555,
"grad_norm": 0.6320285201072693,
"learning_rate": 3.666114680124298e-05,
"loss": 1.044,
"mean_token_accuracy": 0.7290763556957245,
"num_tokens": 21155288.0,
"step": 398
},
{
"epoch": 5.050955414012739,
"grad_norm": 0.6851104497909546,
"learning_rate": 3.620270669645228e-05,
"loss": 1.0028,
"mean_token_accuracy": 0.7407164871692657,
"num_tokens": 21206003.0,
"step": 399
},
{
"epoch": 5.063694267515924,
"grad_norm": 0.9430750012397766,
"learning_rate": 3.574651662720382e-05,
"loss": 1.1002,
"mean_token_accuracy": 0.7209575474262238,
"num_tokens": 21254270.0,
"step": 400
},
{
"epoch": 5.076433121019108,
"grad_norm": 0.9766407012939453,
"learning_rate": 3.5292592682642134e-05,
"loss": 1.0574,
"mean_token_accuracy": 0.7294503152370453,
"num_tokens": 21305776.0,
"step": 401
},
{
"epoch": 5.089171974522293,
"grad_norm": 0.8267378211021423,
"learning_rate": 3.484095087198881e-05,
"loss": 0.9911,
"mean_token_accuracy": 0.7402434647083282,
"num_tokens": 21358915.0,
"step": 402
},
{
"epoch": 5.101910828025478,
"grad_norm": 0.6997200846672058,
"learning_rate": 3.4391607123978095e-05,
"loss": 1.0519,
"mean_token_accuracy": 0.7285727858543396,
"num_tokens": 21414467.0,
"step": 403
},
{
"epoch": 5.114649681528663,
"grad_norm": 0.6674304008483887,
"learning_rate": 3.394457728629489e-05,
"loss": 1.0384,
"mean_token_accuracy": 0.7353217601776123,
"num_tokens": 21468454.0,
"step": 404
},
{
"epoch": 5.127388535031847,
"grad_norm": 0.6918561458587646,
"learning_rate": 3.349987712501591e-05,
"loss": 1.0789,
"mean_token_accuracy": 0.7234221994876862,
"num_tokens": 21520736.0,
"step": 405
},
{
"epoch": 5.140127388535032,
"grad_norm": 0.6514602303504944,
"learning_rate": 3.305752232405377e-05,
"loss": 1.0712,
"mean_token_accuracy": 0.7242619395256042,
"num_tokens": 21577404.0,
"step": 406
},
{
"epoch": 5.1528662420382165,
"grad_norm": 0.6595425009727478,
"learning_rate": 3.2617528484603576e-05,
"loss": 1.0613,
"mean_token_accuracy": 0.7305818200111389,
"num_tokens": 21628435.0,
"step": 407
},
{
"epoch": 5.165605095541402,
"grad_norm": 0.6778191328048706,
"learning_rate": 3.2179911124592966e-05,
"loss": 1.1052,
"mean_token_accuracy": 0.7213633954524994,
"num_tokens": 21680995.0,
"step": 408
},
{
"epoch": 5.178343949044586,
"grad_norm": 0.6973161697387695,
"learning_rate": 3.174468567813461e-05,
"loss": 1.1133,
"mean_token_accuracy": 0.7150149345397949,
"num_tokens": 21736978.0,
"step": 409
},
{
"epoch": 5.191082802547771,
"grad_norm": 0.692443311214447,
"learning_rate": 3.131186749498195e-05,
"loss": 1.0405,
"mean_token_accuracy": 0.7330755889415741,
"num_tokens": 21790319.0,
"step": 410
},
{
"epoch": 5.203821656050955,
"grad_norm": 0.7503440976142883,
"learning_rate": 3.088147183998782e-05,
"loss": 1.101,
"mean_token_accuracy": 0.7169683575630188,
"num_tokens": 21847683.0,
"step": 411
},
{
"epoch": 5.2165605095541405,
"grad_norm": 0.7656980752944946,
"learning_rate": 3.0453513892566197e-05,
"loss": 1.1012,
"mean_token_accuracy": 0.718243807554245,
"num_tokens": 21900904.0,
"step": 412
},
{
"epoch": 5.229299363057325,
"grad_norm": 0.75949627161026,
"learning_rate": 3.0028008746156588e-05,
"loss": 1.0325,
"mean_token_accuracy": 0.7328855395317078,
"num_tokens": 21955480.0,
"step": 413
},
{
"epoch": 5.24203821656051,
"grad_norm": 0.6977457404136658,
"learning_rate": 2.9604971407692027e-05,
"loss": 1.0006,
"mean_token_accuracy": 0.7438418865203857,
"num_tokens": 22007429.0,
"step": 414
},
{
"epoch": 5.254777070063694,
"grad_norm": 0.683573305606842,
"learning_rate": 2.918441679706949e-05,
"loss": 1.0567,
"mean_token_accuracy": 0.7246206998825073,
"num_tokens": 22060919.0,
"step": 415
},
{
"epoch": 5.267515923566879,
"grad_norm": 0.6628759503364563,
"learning_rate": 2.8766359746623894e-05,
"loss": 1.0472,
"mean_token_accuracy": 0.7305993735790253,
"num_tokens": 22116025.0,
"step": 416
},
{
"epoch": 5.280254777070064,
"grad_norm": 0.6662408113479614,
"learning_rate": 2.835081500060498e-05,
"loss": 1.0659,
"mean_token_accuracy": 0.7216311395168304,
"num_tokens": 22173468.0,
"step": 417
},
{
"epoch": 5.292993630573249,
"grad_norm": 0.6621999740600586,
"learning_rate": 2.7937797214657147e-05,
"loss": 1.0885,
"mean_token_accuracy": 0.7194872796535492,
"num_tokens": 22224551.0,
"step": 418
},
{
"epoch": 5.305732484076433,
"grad_norm": 0.6753632426261902,
"learning_rate": 2.7527320955302794e-05,
"loss": 1.1291,
"mean_token_accuracy": 0.71415114402771,
"num_tokens": 22281211.0,
"step": 419
},
{
"epoch": 5.318471337579618,
"grad_norm": 0.6937434673309326,
"learning_rate": 2.7119400699428332e-05,
"loss": 1.0538,
"mean_token_accuracy": 0.733318418264389,
"num_tokens": 22334922.0,
"step": 420
},
{
"epoch": 5.3312101910828025,
"grad_norm": 0.6540622115135193,
"learning_rate": 2.671405083377386e-05,
"loss": 1.0844,
"mean_token_accuracy": 0.72323277592659,
"num_tokens": 22390386.0,
"step": 421
},
{
"epoch": 5.343949044585988,
"grad_norm": 0.7267047166824341,
"learning_rate": 2.6311285654425575e-05,
"loss": 1.0843,
"mean_token_accuracy": 0.7220070958137512,
"num_tokens": 22444403.0,
"step": 422
},
{
"epoch": 5.356687898089172,
"grad_norm": 0.7183628082275391,
"learning_rate": 2.5911119366311597e-05,
"loss": 1.0139,
"mean_token_accuracy": 0.7385392785072327,
"num_tokens": 22495710.0,
"step": 423
},
{
"epoch": 5.369426751592357,
"grad_norm": 0.7213277816772461,
"learning_rate": 2.5513566082701135e-05,
"loss": 1.0277,
"mean_token_accuracy": 0.73272305727005,
"num_tokens": 22547607.0,
"step": 424
},
{
"epoch": 5.382165605095541,
"grad_norm": 0.681786835193634,
"learning_rate": 2.51186398247065e-05,
"loss": 1.041,
"mean_token_accuracy": 0.731095016002655,
"num_tokens": 22597922.0,
"step": 425
},
{
"epoch": 5.3949044585987265,
"grad_norm": 0.6919716000556946,
"learning_rate": 2.472635452078883e-05,
"loss": 0.972,
"mean_token_accuracy": 0.7483727931976318,
"num_tokens": 22650033.0,
"step": 426
},
{
"epoch": 5.407643312101911,
"grad_norm": 0.7305470705032349,
"learning_rate": 2.433672400626663e-05,
"loss": 1.0467,
"mean_token_accuracy": 0.7295823395252228,
"num_tokens": 22706010.0,
"step": 427
},
{
"epoch": 5.420382165605096,
"grad_norm": 0.6791853308677673,
"learning_rate": 2.3949762022828092e-05,
"loss": 1.0977,
"mean_token_accuracy": 0.7203018963336945,
"num_tokens": 22760612.0,
"step": 428
},
{
"epoch": 5.43312101910828,
"grad_norm": 0.6604982614517212,
"learning_rate": 2.3565482218046075e-05,
"loss": 1.0449,
"mean_token_accuracy": 0.731783002614975,
"num_tokens": 22813906.0,
"step": 429
},
{
"epoch": 5.445859872611465,
"grad_norm": 0.6988003849983215,
"learning_rate": 2.3183898144897177e-05,
"loss": 1.0357,
"mean_token_accuracy": 0.7282467782497406,
"num_tokens": 22866208.0,
"step": 430
},
{
"epoch": 5.45859872611465,
"grad_norm": 0.6916972994804382,
"learning_rate": 2.2805023261283497e-05,
"loss": 1.0633,
"mean_token_accuracy": 0.728242814540863,
"num_tokens": 22921899.0,
"step": 431
},
{
"epoch": 5.471337579617835,
"grad_norm": 0.6968501210212708,
"learning_rate": 2.242887092955801e-05,
"loss": 1.0373,
"mean_token_accuracy": 0.7322342693805695,
"num_tokens": 22976617.0,
"step": 432
},
{
"epoch": 5.484076433121019,
"grad_norm": 0.675930917263031,
"learning_rate": 2.2055454416053422e-05,
"loss": 1.1002,
"mean_token_accuracy": 0.7181484699249268,
"num_tokens": 23032361.0,
"step": 433
},
{
"epoch": 5.496815286624204,
"grad_norm": 0.6669013500213623,
"learning_rate": 2.168478689061413e-05,
"loss": 1.0731,
"mean_token_accuracy": 0.722827821969986,
"num_tokens": 23084812.0,
"step": 434
},
{
"epoch": 5.509554140127388,
"grad_norm": 0.7085078358650208,
"learning_rate": 2.131688142613183e-05,
"loss": 1.088,
"mean_token_accuracy": 0.7204846441745758,
"num_tokens": 23138306.0,
"step": 435
},
{
"epoch": 5.522292993630574,
"grad_norm": 0.7120036482810974,
"learning_rate": 2.095175099808444e-05,
"loss": 1.0151,
"mean_token_accuracy": 0.7386319637298584,
"num_tokens": 23191964.0,
"step": 436
},
{
"epoch": 5.535031847133758,
"grad_norm": 0.6772408485412598,
"learning_rate": 2.058940848407854e-05,
"loss": 1.0955,
"mean_token_accuracy": 0.7194060981273651,
"num_tokens": 23247106.0,
"step": 437
},
{
"epoch": 5.547770700636943,
"grad_norm": 0.6788638234138489,
"learning_rate": 2.0229866663395026e-05,
"loss": 1.0669,
"mean_token_accuracy": 0.7293340563774109,
"num_tokens": 23304763.0,
"step": 438
},
{
"epoch": 5.560509554140127,
"grad_norm": 0.6700994968414307,
"learning_rate": 1.987313821653861e-05,
"loss": 1.0693,
"mean_token_accuracy": 0.7236025929450989,
"num_tokens": 23358531.0,
"step": 439
},
{
"epoch": 5.573248407643312,
"grad_norm": 0.6899035573005676,
"learning_rate": 1.951923572479044e-05,
"loss": 1.0717,
"mean_token_accuracy": 0.7225435674190521,
"num_tokens": 23410673.0,
"step": 440
},
{
"epoch": 5.585987261146497,
"grad_norm": 0.7207638025283813,
"learning_rate": 1.9168171669764413e-05,
"loss": 1.0653,
"mean_token_accuracy": 0.7253636419773102,
"num_tokens": 23462065.0,
"step": 441
},
{
"epoch": 5.598726114649682,
"grad_norm": 0.6701375246047974,
"learning_rate": 1.881995843296708e-05,
"loss": 1.0593,
"mean_token_accuracy": 0.728567361831665,
"num_tokens": 23516117.0,
"step": 442
},
{
"epoch": 5.611464968152866,
"grad_norm": 0.7424018979072571,
"learning_rate": 1.847460829536075e-05,
"loss": 1.043,
"mean_token_accuracy": 0.7317372858524323,
"num_tokens": 23567722.0,
"step": 443
},
{
"epoch": 5.624203821656051,
"grad_norm": 0.6817992329597473,
"learning_rate": 1.8132133436930642e-05,
"loss": 1.0661,
"mean_token_accuracy": 0.7273876368999481,
"num_tokens": 23618132.0,
"step": 444
},
{
"epoch": 5.6369426751592355,
"grad_norm": 0.7347919940948486,
"learning_rate": 1.7792545936255013e-05,
"loss": 1.0253,
"mean_token_accuracy": 0.7398423254489899,
"num_tokens": 23669306.0,
"step": 445
},
{
"epoch": 5.649681528662421,
"grad_norm": 0.7186480760574341,
"learning_rate": 1.745585777007943e-05,
"loss": 1.0957,
"mean_token_accuracy": 0.7136403024196625,
"num_tokens": 23720872.0,
"step": 446
},
{
"epoch": 5.662420382165605,
"grad_norm": 0.7350268363952637,
"learning_rate": 1.7122080812894147e-05,
"loss": 1.0426,
"mean_token_accuracy": 0.7309506833553314,
"num_tokens": 23770877.0,
"step": 447
},
{
"epoch": 5.67515923566879,
"grad_norm": 0.7014331221580505,
"learning_rate": 1.679122683651546e-05,
"loss": 1.0368,
"mean_token_accuracy": 0.7311596572399139,
"num_tokens": 23825380.0,
"step": 448
},
{
"epoch": 5.687898089171974,
"grad_norm": 0.6853126287460327,
"learning_rate": 1.6463307509670524e-05,
"loss": 1.0884,
"mean_token_accuracy": 0.7230669856071472,
"num_tokens": 23881723.0,
"step": 449
},
{
"epoch": 5.7006369426751595,
"grad_norm": 0.6790868639945984,
"learning_rate": 1.6138334397585675e-05,
"loss": 1.0867,
"mean_token_accuracy": 0.7211387157440186,
"num_tokens": 23932575.0,
"step": 450
},
{
"epoch": 5.713375796178344,
"grad_norm": 0.6989074349403381,
"learning_rate": 1.5816318961578757e-05,
"loss": 1.0749,
"mean_token_accuracy": 0.7248625159263611,
"num_tokens": 23986604.0,
"step": 451
},
{
"epoch": 5.726114649681529,
"grad_norm": 0.6707603335380554,
"learning_rate": 1.5497272558654697e-05,
"loss": 1.0905,
"mean_token_accuracy": 0.7167878448963165,
"num_tokens": 24041358.0,
"step": 452
},
{
"epoch": 5.738853503184713,
"grad_norm": 0.660871684551239,
"learning_rate": 1.5181206441105078e-05,
"loss": 1.0816,
"mean_token_accuracy": 0.7231634855270386,
"num_tokens": 24095743.0,
"step": 453
},
{
"epoch": 5.751592356687898,
"grad_norm": 0.7151232361793518,
"learning_rate": 1.4868131756111225e-05,
"loss": 1.1497,
"mean_token_accuracy": 0.7055739164352417,
"num_tokens": 24150288.0,
"step": 454
},
{
"epoch": 5.764331210191083,
"grad_norm": 0.6802468299865723,
"learning_rate": 1.4558059545351143e-05,
"loss": 1.039,
"mean_token_accuracy": 0.7299814522266388,
"num_tokens": 24201891.0,
"step": 455
},
{
"epoch": 5.777070063694268,
"grad_norm": 0.6844266057014465,
"learning_rate": 1.4251000744610033e-05,
"loss": 1.0699,
"mean_token_accuracy": 0.7259117960929871,
"num_tokens": 24255851.0,
"step": 456
},
{
"epoch": 5.789808917197452,
"grad_norm": 0.696475088596344,
"learning_rate": 1.394696618339456e-05,
"loss": 1.0644,
"mean_token_accuracy": 0.7264423072338104,
"num_tokens": 24309588.0,
"step": 457
},
{
"epoch": 5.802547770700637,
"grad_norm": 0.7226197719573975,
"learning_rate": 1.364596658455105e-05,
"loss": 1.0641,
"mean_token_accuracy": 0.7255161702632904,
"num_tokens": 24358590.0,
"step": 458
},
{
"epoch": 5.8152866242038215,
"grad_norm": 0.6717948913574219,
"learning_rate": 1.3348012563887102e-05,
"loss": 1.1188,
"mean_token_accuracy": 0.7094634771347046,
"num_tokens": 24410628.0,
"step": 459
},
{
"epoch": 5.828025477707007,
"grad_norm": 0.7298137545585632,
"learning_rate": 1.3053114629797437e-05,
"loss": 1.069,
"mean_token_accuracy": 0.7227195501327515,
"num_tokens": 24465228.0,
"step": 460
},
{
"epoch": 5.840764331210191,
"grad_norm": 0.70267254114151,
"learning_rate": 1.2761283182893047e-05,
"loss": 1.0563,
"mean_token_accuracy": 0.7271043360233307,
"num_tokens": 24519413.0,
"step": 461
},
{
"epoch": 5.853503184713376,
"grad_norm": 0.6809209585189819,
"learning_rate": 1.2472528515634584e-05,
"loss": 1.1122,
"mean_token_accuracy": 0.7165907919406891,
"num_tokens": 24576407.0,
"step": 462
},
{
"epoch": 5.86624203821656,
"grad_norm": 0.6934412717819214,
"learning_rate": 1.218686081196917e-05,
"loss": 1.0996,
"mean_token_accuracy": 0.7188406884670258,
"num_tokens": 24631633.0,
"step": 463
},
{
"epoch": 5.8789808917197455,
"grad_norm": 0.6762963533401489,
"learning_rate": 1.1904290146971397e-05,
"loss": 1.0957,
"mean_token_accuracy": 0.7170492112636566,
"num_tokens": 24685441.0,
"step": 464
},
{
"epoch": 5.89171974522293,
"grad_norm": 0.7013036012649536,
"learning_rate": 1.1624826486487871e-05,
"loss": 1.1055,
"mean_token_accuracy": 0.7152808904647827,
"num_tokens": 24739978.0,
"step": 465
},
{
"epoch": 5.904458598726115,
"grad_norm": 0.6889830231666565,
"learning_rate": 1.1348479686785751e-05,
"loss": 0.9799,
"mean_token_accuracy": 0.7468411326408386,
"num_tokens": 24791608.0,
"step": 466
},
{
"epoch": 5.917197452229299,
"grad_norm": 0.6898278594017029,
"learning_rate": 1.1075259494205225e-05,
"loss": 1.1051,
"mean_token_accuracy": 0.7165685892105103,
"num_tokens": 24844829.0,
"step": 467
},
{
"epoch": 5.929936305732484,
"grad_norm": 0.7092660665512085,
"learning_rate": 1.0805175544815648e-05,
"loss": 1.0596,
"mean_token_accuracy": 0.7260420620441437,
"num_tokens": 24896024.0,
"step": 468
},
{
"epoch": 5.942675159235669,
"grad_norm": 0.6775749921798706,
"learning_rate": 1.0538237364075787e-05,
"loss": 1.0825,
"mean_token_accuracy": 0.7203651666641235,
"num_tokens": 24949324.0,
"step": 469
},
{
"epoch": 5.955414012738854,
"grad_norm": 0.6780968308448792,
"learning_rate": 1.0274454366497787e-05,
"loss": 1.0594,
"mean_token_accuracy": 0.7282997369766235,
"num_tokens": 25000988.0,
"step": 470
},
{
"epoch": 5.968152866242038,
"grad_norm": 0.7077444195747375,
"learning_rate": 1.0013835855315235e-05,
"loss": 1.0463,
"mean_token_accuracy": 0.7352750301361084,
"num_tokens": 25051001.0,
"step": 471
},
{
"epoch": 5.980891719745223,
"grad_norm": 0.6713427305221558,
"learning_rate": 9.756391022154954e-06,
"loss": 1.0665,
"mean_token_accuracy": 0.7268872261047363,
"num_tokens": 25107428.0,
"step": 472
},
{
"epoch": 5.993630573248407,
"grad_norm": 0.6871688961982727,
"learning_rate": 9.502128946712862e-06,
"loss": 1.0956,
"mean_token_accuracy": 0.7180374562740326,
"num_tokens": 25162781.0,
"step": 473
},
{
"epoch": 6.0,
"grad_norm": 1.0545368194580078,
"learning_rate": 9.251058596433793e-06,
"loss": 0.9163,
"mean_token_accuracy": 0.7619118690490723,
"num_tokens": 25189656.0,
"step": 474
},
{
"epoch": 6.012738853503185,
"grad_norm": 0.7146143913269043,
"learning_rate": 9.003188826195142e-06,
"loss": 0.9193,
"mean_token_accuracy": 0.7621127963066101,
"num_tokens": 25240863.0,
"step": 475
},
{
"epoch": 6.025477707006369,
"grad_norm": 0.7108073830604553,
"learning_rate": 8.758528377994667e-06,
"loss": 0.96,
"mean_token_accuracy": 0.7582462728023529,
"num_tokens": 25294260.0,
"step": 476
},
{
"epoch": 6.038216560509555,
"grad_norm": 0.6869873404502869,
"learning_rate": 8.517085880642062e-06,
"loss": 0.9756,
"mean_token_accuracy": 0.749285876750946,
"num_tokens": 25348579.0,
"step": 477
},
{
"epoch": 6.050955414012739,
"grad_norm": 0.6845804452896118,
"learning_rate": 8.278869849454718e-06,
"loss": 0.8822,
"mean_token_accuracy": 0.7715561091899872,
"num_tokens": 25401401.0,
"step": 478
},
{
"epoch": 6.063694267515924,
"grad_norm": 0.6910164952278137,
"learning_rate": 8.043888685957313e-06,
"loss": 0.9433,
"mean_token_accuracy": 0.7562872767448425,
"num_tokens": 25454769.0,
"step": 479
},
{
"epoch": 6.076433121019108,
"grad_norm": 0.7341907620429993,
"learning_rate": 7.812150677585673e-06,
"loss": 0.9085,
"mean_token_accuracy": 0.7656155228614807,
"num_tokens": 25506726.0,
"step": 480
},
{
"epoch": 6.089171974522293,
"grad_norm": 0.781583845615387,
"learning_rate": 7.583663997394241e-06,
"loss": 0.8805,
"mean_token_accuracy": 0.7671515941619873,
"num_tokens": 25557160.0,
"step": 481
},
{
"epoch": 6.101910828025478,
"grad_norm": 0.8239176273345947,
"learning_rate": 7.358436703768035e-06,
"loss": 0.9748,
"mean_token_accuracy": 0.7472788989543915,
"num_tokens": 25610789.0,
"step": 482
},
{
"epoch": 6.114649681528663,
"grad_norm": 0.8466070890426636,
"learning_rate": 7.136476740138387e-06,
"loss": 0.993,
"mean_token_accuracy": 0.7422117292881012,
"num_tokens": 25665950.0,
"step": 483
},
{
"epoch": 6.127388535031847,
"grad_norm": 0.8602212071418762,
"learning_rate": 6.917791934702655e-06,
"loss": 0.9483,
"mean_token_accuracy": 0.7557033598423004,
"num_tokens": 25718919.0,
"step": 484
},
{
"epoch": 6.140127388535032,
"grad_norm": 0.8259091377258301,
"learning_rate": 6.702390000148351e-06,
"loss": 0.8463,
"mean_token_accuracy": 0.777842104434967,
"num_tokens": 25767903.0,
"step": 485
},
{
"epoch": 6.1528662420382165,
"grad_norm": 0.8399609327316284,
"learning_rate": 6.490278533380956e-06,
"loss": 0.9647,
"mean_token_accuracy": 0.7500897943973541,
"num_tokens": 25822750.0,
"step": 486
},
{
"epoch": 6.165605095541402,
"grad_norm": 0.7666255831718445,
"learning_rate": 6.281465015256094e-06,
"loss": 0.9125,
"mean_token_accuracy": 0.7626084089279175,
"num_tokens": 25874905.0,
"step": 487
},
{
"epoch": 6.178343949044586,
"grad_norm": 0.7555410265922546,
"learning_rate": 6.0759568103156195e-06,
"loss": 0.7986,
"mean_token_accuracy": 0.7909380793571472,
"num_tokens": 25925230.0,
"step": 488
},
{
"epoch": 6.191082802547771,
"grad_norm": 0.7381100058555603,
"learning_rate": 5.873761166527936e-06,
"loss": 0.9506,
"mean_token_accuracy": 0.7554153203964233,
"num_tokens": 25977993.0,
"step": 489
},
{
"epoch": 6.203821656050955,
"grad_norm": 0.7189981937408447,
"learning_rate": 5.674885215032322e-06,
"loss": 0.87,
"mean_token_accuracy": 0.7736336588859558,
"num_tokens": 26031705.0,
"step": 490
},
{
"epoch": 6.2165605095541405,
"grad_norm": 0.7386711239814758,
"learning_rate": 5.479335969887467e-06,
"loss": 0.9832,
"mean_token_accuracy": 0.7475563585758209,
"num_tokens": 26083671.0,
"step": 491
},
{
"epoch": 6.229299363057325,
"grad_norm": 0.7135651111602783,
"learning_rate": 5.287120327824091e-06,
"loss": 0.94,
"mean_token_accuracy": 0.7552074790000916,
"num_tokens": 26135859.0,
"step": 492
},
{
"epoch": 6.24203821656051,
"grad_norm": 0.7520937323570251,
"learning_rate": 5.098245068001661e-06,
"loss": 0.8988,
"mean_token_accuracy": 0.7664923667907715,
"num_tokens": 26184826.0,
"step": 493
},
{
"epoch": 6.254777070063694,
"grad_norm": 0.7178412675857544,
"learning_rate": 4.9127168517693946e-06,
"loss": 0.9459,
"mean_token_accuracy": 0.7564821839332581,
"num_tokens": 26239493.0,
"step": 494
},
{
"epoch": 6.267515923566879,
"grad_norm": 0.701515793800354,
"learning_rate": 4.730542222431223e-06,
"loss": 0.9265,
"mean_token_accuracy": 0.7591147124767303,
"num_tokens": 26294426.0,
"step": 495
},
{
"epoch": 6.280254777070064,
"grad_norm": 0.7227333784103394,
"learning_rate": 4.551727605015032e-06,
"loss": 0.937,
"mean_token_accuracy": 0.7586305141448975,
"num_tokens": 26346551.0,
"step": 496
},
{
"epoch": 6.292993630573249,
"grad_norm": 0.7054842114448547,
"learning_rate": 4.376279306046183e-06,
"loss": 0.9727,
"mean_token_accuracy": 0.7496200203895569,
"num_tokens": 26401101.0,
"step": 497
},
{
"epoch": 6.305732484076433,
"grad_norm": 0.7149825692176819,
"learning_rate": 4.2042035133248895e-06,
"loss": 0.921,
"mean_token_accuracy": 0.7641755938529968,
"num_tokens": 26451879.0,
"step": 498
},
{
"epoch": 6.318471337579618,
"grad_norm": 0.6818841695785522,
"learning_rate": 4.035506295708191e-06,
"loss": 0.9648,
"mean_token_accuracy": 0.74892657995224,
"num_tokens": 26509991.0,
"step": 499
},
{
"epoch": 6.3312101910828025,
"grad_norm": 0.717536211013794,
"learning_rate": 3.870193602895733e-06,
"loss": 0.8917,
"mean_token_accuracy": 0.7688518166542053,
"num_tokens": 26563939.0,
"step": 500
},
{
"epoch": 6.343949044585988,
"grad_norm": 0.7026060819625854,
"learning_rate": 3.7082712652200867e-06,
"loss": 0.8955,
"mean_token_accuracy": 0.7676977217197418,
"num_tokens": 26618063.0,
"step": 501
},
{
"epoch": 6.356687898089172,
"grad_norm": 0.7318772673606873,
"learning_rate": 3.54974499344094e-06,
"loss": 0.8681,
"mean_token_accuracy": 0.7763055860996246,
"num_tokens": 26669002.0,
"step": 502
},
{
"epoch": 6.369426751592357,
"grad_norm": 0.7441863417625427,
"learning_rate": 3.3946203785439113e-06,
"loss": 0.9924,
"mean_token_accuracy": 0.7483593821525574,
"num_tokens": 26721230.0,
"step": 503
},
{
"epoch": 6.382165605095541,
"grad_norm": 0.7195377349853516,
"learning_rate": 3.2429028915431534e-06,
"loss": 0.9839,
"mean_token_accuracy": 0.7457345724105835,
"num_tokens": 26776267.0,
"step": 504
},
{
"epoch": 6.3949044585987265,
"grad_norm": 0.7469968795776367,
"learning_rate": 3.094597883288575e-06,
"loss": 0.9288,
"mean_token_accuracy": 0.7621110081672668,
"num_tokens": 26826994.0,
"step": 505
},
{
"epoch": 6.407643312101911,
"grad_norm": 0.73201584815979,
"learning_rate": 2.9497105842769435e-06,
"loss": 0.9608,
"mean_token_accuracy": 0.7524427771568298,
"num_tokens": 26881841.0,
"step": 506
},
{
"epoch": 6.420382165605096,
"grad_norm": 0.7143669128417969,
"learning_rate": 2.808246104467582e-06,
"loss": 0.969,
"mean_token_accuracy": 0.7490289807319641,
"num_tokens": 26937886.0,
"step": 507
},
{
"epoch": 6.43312101910828,
"grad_norm": 0.725846529006958,
"learning_rate": 2.6702094331020887e-06,
"loss": 0.8699,
"mean_token_accuracy": 0.774571418762207,
"num_tokens": 26992609.0,
"step": 508
},
{
"epoch": 6.445859872611465,
"grad_norm": 0.7519891262054443,
"learning_rate": 2.5356054385282766e-06,
"loss": 0.9874,
"mean_token_accuracy": 0.745583564043045,
"num_tokens": 27048708.0,
"step": 509
},
{
"epoch": 6.45859872611465,
"grad_norm": 0.7535760402679443,
"learning_rate": 2.404438868028658e-06,
"loss": 0.9721,
"mean_token_accuracy": 0.7467173933982849,
"num_tokens": 27100485.0,
"step": 510
},
{
"epoch": 6.471337579617835,
"grad_norm": 0.7484342455863953,
"learning_rate": 2.276714347652831e-06,
"loss": 0.9892,
"mean_token_accuracy": 0.742410272359848,
"num_tokens": 27155364.0,
"step": 511
},
{
"epoch": 6.484076433121019,
"grad_norm": 0.76715487241745,
"learning_rate": 2.152436382054479e-06,
"loss": 0.9417,
"mean_token_accuracy": 0.7548108398914337,
"num_tokens": 27207302.0,
"step": 512
},
{
"epoch": 6.496815286624204,
"grad_norm": 0.758468508720398,
"learning_rate": 2.0316093543323757e-06,
"loss": 0.9241,
"mean_token_accuracy": 0.7589289247989655,
"num_tokens": 27259183.0,
"step": 513
},
{
"epoch": 6.509554140127388,
"grad_norm": 0.7331240773200989,
"learning_rate": 1.914237525875917e-06,
"loss": 0.9083,
"mean_token_accuracy": 0.7633899450302124,
"num_tokens": 27315637.0,
"step": 514
},
{
"epoch": 6.522292993630574,
"grad_norm": 0.7536838054656982,
"learning_rate": 1.8003250362147005e-06,
"loss": 0.8289,
"mean_token_accuracy": 0.7863086462020874,
"num_tokens": 27363581.0,
"step": 515
},
{
"epoch": 6.535031847133758,
"grad_norm": 0.7688658237457275,
"learning_rate": 1.6898759028726285e-06,
"loss": 0.9068,
"mean_token_accuracy": 0.7663577497005463,
"num_tokens": 27414563.0,
"step": 516
},
{
"epoch": 6.547770700636943,
"grad_norm": 0.7456837892532349,
"learning_rate": 1.5828940212261889e-06,
"loss": 0.9489,
"mean_token_accuracy": 0.7578501403331757,
"num_tokens": 27468282.0,
"step": 517
},
{
"epoch": 6.560509554140127,
"grad_norm": 0.7611333727836609,
"learning_rate": 1.479383164367043e-06,
"loss": 0.9226,
"mean_token_accuracy": 0.7618197500705719,
"num_tokens": 27521855.0,
"step": 518
},
{
"epoch": 6.573248407643312,
"grad_norm": 0.7308273911476135,
"learning_rate": 1.3793469829689987e-06,
"loss": 0.869,
"mean_token_accuracy": 0.7722784578800201,
"num_tokens": 27573254.0,
"step": 519
},
{
"epoch": 6.585987261146497,
"grad_norm": 0.7272342443466187,
"learning_rate": 1.2827890051592128e-06,
"loss": 0.9277,
"mean_token_accuracy": 0.7642932236194611,
"num_tokens": 27626306.0,
"step": 520
},
{
"epoch": 6.598726114649682,
"grad_norm": 0.7377881407737732,
"learning_rate": 1.1897126363937804e-06,
"loss": 0.9001,
"mean_token_accuracy": 0.7653520107269287,
"num_tokens": 27679236.0,
"step": 521
},
{
"epoch": 6.611464968152866,
"grad_norm": 0.7138490676879883,
"learning_rate": 1.1001211593376526e-06,
"loss": 0.9717,
"mean_token_accuracy": 0.7485788762569427,
"num_tokens": 27736906.0,
"step": 522
},
{
"epoch": 6.624203821656051,
"grad_norm": 0.7349875569343567,
"learning_rate": 1.0140177337488288e-06,
"loss": 0.9787,
"mean_token_accuracy": 0.748003751039505,
"num_tokens": 27791678.0,
"step": 523
},
{
"epoch": 6.6369426751592355,
"grad_norm": 0.7070578932762146,
"learning_rate": 9.314053963669245e-07,
"loss": 0.8897,
"mean_token_accuracy": 0.7702184617519379,
"num_tokens": 27848075.0,
"step": 524
},
{
"epoch": 6.649681528662421,
"grad_norm": 0.7422825694084167,
"learning_rate": 8.522870608060563e-07,
"loss": 0.9565,
"mean_token_accuracy": 0.7540837526321411,
"num_tokens": 27902710.0,
"step": 525
},
{
"epoch": 6.662420382165605,
"grad_norm": 0.730220377445221,
"learning_rate": 7.766655174521465e-07,
"loss": 1.0155,
"mean_token_accuracy": 0.7437026798725128,
"num_tokens": 27957500.0,
"step": 526
},
{
"epoch": 6.67515923566879,
"grad_norm": 0.7156116366386414,
"learning_rate": 7.045434333643797e-07,
"loss": 0.8918,
"mean_token_accuracy": 0.7693358361721039,
"num_tokens": 28010748.0,
"step": 527
},
{
"epoch": 6.687898089171974,
"grad_norm": 0.7323397397994995,
"learning_rate": 6.359233521813224e-07,
"loss": 0.9435,
"mean_token_accuracy": 0.7566266059875488,
"num_tokens": 28064640.0,
"step": 528
},
{
"epoch": 6.7006369426751595,
"grad_norm": 0.726648211479187,
"learning_rate": 5.70807694031028e-07,
"loss": 0.9328,
"mean_token_accuracy": 0.7591494917869568,
"num_tokens": 28117822.0,
"step": 529
},
{
"epoch": 6.713375796178344,
"grad_norm": 0.7227804064750671,
"learning_rate": 5.091987554458388e-07,
"loss": 0.9072,
"mean_token_accuracy": 0.7651616930961609,
"num_tokens": 28171144.0,
"step": 530
},
{
"epoch": 6.726114649681529,
"grad_norm": 0.7124402523040771,
"learning_rate": 4.510987092812502e-07,
"loss": 0.9306,
"mean_token_accuracy": 0.7630573511123657,
"num_tokens": 28226940.0,
"step": 531
},
{
"epoch": 6.738853503184713,
"grad_norm": 0.7292929291725159,
"learning_rate": 3.965096046394057e-07,
"loss": 0.9498,
"mean_token_accuracy": 0.7523236572742462,
"num_tokens": 28280454.0,
"step": 532
},
{
"epoch": 6.751592356687898,
"grad_norm": 0.727213442325592,
"learning_rate": 3.4543336679673245e-07,
"loss": 0.9254,
"mean_token_accuracy": 0.7609288394451141,
"num_tokens": 28333652.0,
"step": 533
},
{
"epoch": 6.764331210191083,
"grad_norm": 0.7489280700683594,
"learning_rate": 2.978717971360956e-07,
"loss": 0.9043,
"mean_token_accuracy": 0.7611273527145386,
"num_tokens": 28386449.0,
"step": 534
},
{
"epoch": 6.777070063694268,
"grad_norm": 0.7415534853935242,
"learning_rate": 2.5382657308322676e-07,
"loss": 0.95,
"mean_token_accuracy": 0.7531686425209045,
"num_tokens": 28441114.0,
"step": 535
},
{
"epoch": 6.789808917197452,
"grad_norm": 0.7236829996109009,
"learning_rate": 2.1329924804760482e-07,
"loss": 0.9313,
"mean_token_accuracy": 0.7573466897010803,
"num_tokens": 28495316.0,
"step": 536
},
{
"epoch": 6.802547770700637,
"grad_norm": 0.7350640892982483,
"learning_rate": 1.7629125136764402e-07,
"loss": 0.916,
"mean_token_accuracy": 0.7613226473331451,
"num_tokens": 28548205.0,
"step": 537
},
{
"epoch": 6.8152866242038215,
"grad_norm": 0.7304351925849915,
"learning_rate": 1.4280388826026782e-07,
"loss": 0.9143,
"mean_token_accuracy": 0.7636158764362335,
"num_tokens": 28601790.0,
"step": 538
},
{
"epoch": 6.828025477707007,
"grad_norm": 0.7234811782836914,
"learning_rate": 1.128383397749233e-07,
"loss": 0.9575,
"mean_token_accuracy": 0.7551866471767426,
"num_tokens": 28659230.0,
"step": 539
},
{
"epoch": 6.840764331210191,
"grad_norm": 0.7419787645339966,
"learning_rate": 8.639566275189248e-08,
"loss": 0.9157,
"mean_token_accuracy": 0.7586352527141571,
"num_tokens": 28711026.0,
"step": 540
},
{
"epoch": 6.853503184713376,
"grad_norm": 0.7123546600341797,
"learning_rate": 6.347678978501082e-08,
"loss": 0.8872,
"mean_token_accuracy": 0.7726410031318665,
"num_tokens": 28765739.0,
"step": 541
},
{
"epoch": 6.86624203821656,
"grad_norm": 0.713035523891449,
"learning_rate": 4.408252918880473e-08,
"loss": 0.8992,
"mean_token_accuracy": 0.7651358842849731,
"num_tokens": 28821630.0,
"step": 542
},
{
"epoch": 6.8789808917197455,
"grad_norm": 0.7332026958465576,
"learning_rate": 2.8213564969969963e-08,
"loss": 0.9474,
"mean_token_accuracy": 0.7548873424530029,
"num_tokens": 28875172.0,
"step": 543
},
{
"epoch": 6.89171974522293,
"grad_norm": 0.6980507969856262,
"learning_rate": 1.5870456803246392e-08,
"loss": 0.8873,
"mean_token_accuracy": 0.7682437002658844,
"num_tokens": 28930288.0,
"step": 544
},
{
"epoch": 6.904458598726115,
"grad_norm": 0.7101753354072571,
"learning_rate": 7.053640011678297e-09,
"loss": 0.8794,
"mean_token_accuracy": 0.770586758852005,
"num_tokens": 28985767.0,
"step": 545
},
{
"epoch": 6.917197452229299,
"grad_norm": 0.7474488615989685,
"learning_rate": 1.7634255512710695e-09,
"loss": 0.9525,
"mean_token_accuracy": 0.7564700543880463,
"num_tokens": 29037462.0,
"step": 546
},
{
"epoch": 6.917197452229299,
"step": 546,
"total_flos": 1.6379330686038835e+18,
"train_loss": 1.6175817059073256,
"train_runtime": 3399.6626,
"train_samples_per_second": 10.295,
"train_steps_per_second": 0.161
}
],
"logging_steps": 1.0,
"max_steps": 546,
"num_input_tokens_seen": 0,
"num_train_epochs": 7,
"save_steps": 100,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": true
},
"attributes": {}
}
},
"total_flos": 1.6379330686038835e+18,
"train_batch_size": 8,
"trial_name": null,
"trial_params": null
}