| { |
| "best_global_step": null, |
| "best_metric": null, |
| "best_model_checkpoint": null, |
| "epoch": 6.917197452229299, |
| "eval_steps": 500, |
| "global_step": 546, |
| "is_hyper_param_search": false, |
| "is_local_process_zero": true, |
| "is_world_process_zero": true, |
| "log_history": [ |
| { |
| "epoch": 0.012738853503184714, |
| "grad_norm": 4.761112689971924, |
| "learning_rate": 0.0, |
| "loss": 3.2869, |
| "mean_token_accuracy": 0.41092178225517273, |
| "num_tokens": 49462.0, |
| "step": 1 |
| }, |
| { |
| "epoch": 0.025477707006369428, |
| "grad_norm": 4.703872203826904, |
| "learning_rate": 1.1764705882352942e-05, |
| "loss": 3.2731, |
| "mean_token_accuracy": 0.4127148687839508, |
| "num_tokens": 103343.0, |
| "step": 2 |
| }, |
| { |
| "epoch": 0.03821656050955414, |
| "grad_norm": 4.704084396362305, |
| "learning_rate": 2.3529411764705884e-05, |
| "loss": 3.2686, |
| "mean_token_accuracy": 0.40740063786506653, |
| "num_tokens": 159396.0, |
| "step": 3 |
| }, |
| { |
| "epoch": 0.050955414012738856, |
| "grad_norm": 3.6533823013305664, |
| "learning_rate": 3.529411764705883e-05, |
| "loss": 3.083, |
| "mean_token_accuracy": 0.42516854405403137, |
| "num_tokens": 214939.0, |
| "step": 4 |
| }, |
| { |
| "epoch": 0.06369426751592357, |
| "grad_norm": 2.070547342300415, |
| "learning_rate": 4.705882352941177e-05, |
| "loss": 2.9803, |
| "mean_token_accuracy": 0.4312178045511246, |
| "num_tokens": 269347.0, |
| "step": 5 |
| }, |
| { |
| "epoch": 0.07643312101910828, |
| "grad_norm": 0.8171060085296631, |
| "learning_rate": 5.882352941176471e-05, |
| "loss": 2.8637, |
| "mean_token_accuracy": 0.4366413652896881, |
| "num_tokens": 322665.0, |
| "step": 6 |
| }, |
| { |
| "epoch": 0.08917197452229299, |
| "grad_norm": 1.5951858758926392, |
| "learning_rate": 7.058823529411765e-05, |
| "loss": 2.791, |
| "mean_token_accuracy": 0.44802916049957275, |
| "num_tokens": 376321.0, |
| "step": 7 |
| }, |
| { |
| "epoch": 0.10191082802547771, |
| "grad_norm": 1.059572696685791, |
| "learning_rate": 8.23529411764706e-05, |
| "loss": 2.761, |
| "mean_token_accuracy": 0.44592560827732086, |
| "num_tokens": 432471.0, |
| "step": 8 |
| }, |
| { |
| "epoch": 0.11464968152866242, |
| "grad_norm": 0.7089035511016846, |
| "learning_rate": 9.411764705882353e-05, |
| "loss": 2.6454, |
| "mean_token_accuracy": 0.4627067297697067, |
| "num_tokens": 484508.0, |
| "step": 9 |
| }, |
| { |
| "epoch": 0.12738853503184713, |
| "grad_norm": 0.6159243583679199, |
| "learning_rate": 0.00010588235294117647, |
| "loss": 2.6692, |
| "mean_token_accuracy": 0.45023128390312195, |
| "num_tokens": 539575.0, |
| "step": 10 |
| }, |
| { |
| "epoch": 0.14012738853503184, |
| "grad_norm": 0.4188247621059418, |
| "learning_rate": 0.00011764705882352942, |
| "loss": 2.6219, |
| "mean_token_accuracy": 0.45925579965114594, |
| "num_tokens": 595661.0, |
| "step": 11 |
| }, |
| { |
| "epoch": 0.15286624203821655, |
| "grad_norm": 0.4733411371707916, |
| "learning_rate": 0.00012941176470588237, |
| "loss": 2.5438, |
| "mean_token_accuracy": 0.4694492220878601, |
| "num_tokens": 649252.0, |
| "step": 12 |
| }, |
| { |
| "epoch": 0.16560509554140126, |
| "grad_norm": 0.5128419995307922, |
| "learning_rate": 0.0001411764705882353, |
| "loss": 2.4735, |
| "mean_token_accuracy": 0.4854963421821594, |
| "num_tokens": 698181.0, |
| "step": 13 |
| }, |
| { |
| "epoch": 0.17834394904458598, |
| "grad_norm": 0.3656497597694397, |
| "learning_rate": 0.00015294117647058822, |
| "loss": 2.5031, |
| "mean_token_accuracy": 0.4764190912246704, |
| "num_tokens": 751997.0, |
| "step": 14 |
| }, |
| { |
| "epoch": 0.1910828025477707, |
| "grad_norm": 0.3084503412246704, |
| "learning_rate": 0.0001647058823529412, |
| "loss": 2.5714, |
| "mean_token_accuracy": 0.46718260645866394, |
| "num_tokens": 804157.0, |
| "step": 15 |
| }, |
| { |
| "epoch": 0.20382165605095542, |
| "grad_norm": 0.36686044931411743, |
| "learning_rate": 0.00017647058823529413, |
| "loss": 2.4946, |
| "mean_token_accuracy": 0.4779031127691269, |
| "num_tokens": 857853.0, |
| "step": 16 |
| }, |
| { |
| "epoch": 0.21656050955414013, |
| "grad_norm": 0.29674139618873596, |
| "learning_rate": 0.00018823529411764707, |
| "loss": 2.5163, |
| "mean_token_accuracy": 0.4771920293569565, |
| "num_tokens": 911658.0, |
| "step": 17 |
| }, |
| { |
| "epoch": 0.22929936305732485, |
| "grad_norm": 0.2850172817707062, |
| "learning_rate": 0.0002, |
| "loss": 2.4394, |
| "mean_token_accuracy": 0.4859432280063629, |
| "num_tokens": 966472.0, |
| "step": 18 |
| }, |
| { |
| "epoch": 0.24203821656050956, |
| "grad_norm": 0.35271042585372925, |
| "learning_rate": 0.00019999823657444873, |
| "loss": 2.4561, |
| "mean_token_accuracy": 0.48405739665031433, |
| "num_tokens": 1021121.0, |
| "step": 19 |
| }, |
| { |
| "epoch": 0.25477707006369427, |
| "grad_norm": 0.31650495529174805, |
| "learning_rate": 0.00019999294635998833, |
| "loss": 2.4687, |
| "mean_token_accuracy": 0.4840937405824661, |
| "num_tokens": 1073873.0, |
| "step": 20 |
| }, |
| { |
| "epoch": 0.267515923566879, |
| "grad_norm": 0.2682850658893585, |
| "learning_rate": 0.00019998412954319675, |
| "loss": 2.4815, |
| "mean_token_accuracy": 0.48027853667736053, |
| "num_tokens": 1127694.0, |
| "step": 21 |
| }, |
| { |
| "epoch": 0.2802547770700637, |
| "grad_norm": 0.2755778431892395, |
| "learning_rate": 0.00019997178643503004, |
| "loss": 2.4284, |
| "mean_token_accuracy": 0.48824429512023926, |
| "num_tokens": 1182019.0, |
| "step": 22 |
| }, |
| { |
| "epoch": 0.2929936305732484, |
| "grad_norm": 0.24972540140151978, |
| "learning_rate": 0.00019995591747081122, |
| "loss": 2.4494, |
| "mean_token_accuracy": 0.4878968298435211, |
| "num_tokens": 1236984.0, |
| "step": 23 |
| }, |
| { |
| "epoch": 0.3057324840764331, |
| "grad_norm": 0.2714020013809204, |
| "learning_rate": 0.000199936523210215, |
| "loss": 2.4214, |
| "mean_token_accuracy": 0.48719431459903717, |
| "num_tokens": 1290713.0, |
| "step": 24 |
| }, |
| { |
| "epoch": 0.3184713375796178, |
| "grad_norm": 0.2532528340816498, |
| "learning_rate": 0.00019991360433724813, |
| "loss": 2.4032, |
| "mean_token_accuracy": 0.4961143136024475, |
| "num_tokens": 1342478.0, |
| "step": 25 |
| }, |
| { |
| "epoch": 0.33121019108280253, |
| "grad_norm": 0.24254582822322845, |
| "learning_rate": 0.0001998871616602251, |
| "loss": 2.4002, |
| "mean_token_accuracy": 0.4875377267599106, |
| "num_tokens": 1399050.0, |
| "step": 26 |
| }, |
| { |
| "epoch": 0.34394904458598724, |
| "grad_norm": 0.28501322865486145, |
| "learning_rate": 0.00019985719611173973, |
| "loss": 2.3697, |
| "mean_token_accuracy": 0.4995545297861099, |
| "num_tokens": 1450903.0, |
| "step": 27 |
| }, |
| { |
| "epoch": 0.35668789808917195, |
| "grad_norm": 0.23500725626945496, |
| "learning_rate": 0.00019982370874863236, |
| "loss": 2.4132, |
| "mean_token_accuracy": 0.4906390905380249, |
| "num_tokens": 1502703.0, |
| "step": 28 |
| }, |
| { |
| "epoch": 0.36942675159235666, |
| "grad_norm": 0.30180564522743225, |
| "learning_rate": 0.0001997867007519524, |
| "loss": 2.3696, |
| "mean_token_accuracy": 0.49948596954345703, |
| "num_tokens": 1554830.0, |
| "step": 29 |
| }, |
| { |
| "epoch": 0.3821656050955414, |
| "grad_norm": 0.2490658164024353, |
| "learning_rate": 0.00019974617342691678, |
| "loss": 2.3408, |
| "mean_token_accuracy": 0.5027014017105103, |
| "num_tokens": 1608232.0, |
| "step": 30 |
| }, |
| { |
| "epoch": 0.39490445859872614, |
| "grad_norm": 0.24896252155303955, |
| "learning_rate": 0.00019970212820286394, |
| "loss": 2.4234, |
| "mean_token_accuracy": 0.4829110950231552, |
| "num_tokens": 1664017.0, |
| "step": 31 |
| }, |
| { |
| "epoch": 0.40764331210191085, |
| "grad_norm": 0.25039437413215637, |
| "learning_rate": 0.00019965456663320329, |
| "loss": 2.3917, |
| "mean_token_accuracy": 0.48753800988197327, |
| "num_tokens": 1720089.0, |
| "step": 32 |
| }, |
| { |
| "epoch": 0.42038216560509556, |
| "grad_norm": 0.22132936120033264, |
| "learning_rate": 0.00019960349039536062, |
| "loss": 2.3627, |
| "mean_token_accuracy": 0.4972927123308182, |
| "num_tokens": 1774726.0, |
| "step": 33 |
| }, |
| { |
| "epoch": 0.43312101910828027, |
| "grad_norm": 0.2938268780708313, |
| "learning_rate": 0.00019954890129071876, |
| "loss": 2.2881, |
| "mean_token_accuracy": 0.5129408538341522, |
| "num_tokens": 1825040.0, |
| "step": 34 |
| }, |
| { |
| "epoch": 0.445859872611465, |
| "grad_norm": 0.24302712082862854, |
| "learning_rate": 0.00019949080124455416, |
| "loss": 2.2596, |
| "mean_token_accuracy": 0.5119624435901642, |
| "num_tokens": 1874103.0, |
| "step": 35 |
| }, |
| { |
| "epoch": 0.4585987261146497, |
| "grad_norm": 0.2339584231376648, |
| "learning_rate": 0.00019942919230596896, |
| "loss": 2.3253, |
| "mean_token_accuracy": 0.5040525794029236, |
| "num_tokens": 1927131.0, |
| "step": 36 |
| }, |
| { |
| "epoch": 0.4713375796178344, |
| "grad_norm": 0.2367529571056366, |
| "learning_rate": 0.00019936407664781868, |
| "loss": 2.3364, |
| "mean_token_accuracy": 0.49800464510917664, |
| "num_tokens": 1980917.0, |
| "step": 37 |
| }, |
| { |
| "epoch": 0.4840764331210191, |
| "grad_norm": 0.2430427372455597, |
| "learning_rate": 0.00019929545656663562, |
| "loss": 2.3208, |
| "mean_token_accuracy": 0.5083869993686676, |
| "num_tokens": 2038766.0, |
| "step": 38 |
| }, |
| { |
| "epoch": 0.4968152866242038, |
| "grad_norm": 0.23850445449352264, |
| "learning_rate": 0.00019922333448254786, |
| "loss": 2.2224, |
| "mean_token_accuracy": 0.51767298579216, |
| "num_tokens": 2091004.0, |
| "step": 39 |
| }, |
| { |
| "epoch": 0.5095541401273885, |
| "grad_norm": 0.24451673030853271, |
| "learning_rate": 0.00019914771293919395, |
| "loss": 2.2564, |
| "mean_token_accuracy": 0.5176732242107391, |
| "num_tokens": 2140073.0, |
| "step": 40 |
| }, |
| { |
| "epoch": 0.5222929936305732, |
| "grad_norm": 0.24077007174491882, |
| "learning_rate": 0.00019906859460363307, |
| "loss": 2.269, |
| "mean_token_accuracy": 0.5150171518325806, |
| "num_tokens": 2188061.0, |
| "step": 41 |
| }, |
| { |
| "epoch": 0.535031847133758, |
| "grad_norm": 0.24033866822719574, |
| "learning_rate": 0.00019898598226625119, |
| "loss": 2.3521, |
| "mean_token_accuracy": 0.5002244710922241, |
| "num_tokens": 2238848.0, |
| "step": 42 |
| }, |
| { |
| "epoch": 0.5477707006369427, |
| "grad_norm": 0.26337239146232605, |
| "learning_rate": 0.00019889987884066237, |
| "loss": 2.289, |
| "mean_token_accuracy": 0.5045580565929413, |
| "num_tokens": 2290423.0, |
| "step": 43 |
| }, |
| { |
| "epoch": 0.5605095541401274, |
| "grad_norm": 0.25623688101768494, |
| "learning_rate": 0.00019881028736360622, |
| "loss": 2.3905, |
| "mean_token_accuracy": 0.49077165126800537, |
| "num_tokens": 2346796.0, |
| "step": 44 |
| }, |
| { |
| "epoch": 0.5732484076433121, |
| "grad_norm": 0.2281937599182129, |
| "learning_rate": 0.0001987172109948408, |
| "loss": 2.2994, |
| "mean_token_accuracy": 0.5028359293937683, |
| "num_tokens": 2398134.0, |
| "step": 45 |
| }, |
| { |
| "epoch": 0.5859872611464968, |
| "grad_norm": 0.27723079919815063, |
| "learning_rate": 0.000198620653017031, |
| "loss": 2.288, |
| "mean_token_accuracy": 0.5047226399183273, |
| "num_tokens": 2451183.0, |
| "step": 46 |
| }, |
| { |
| "epoch": 0.5987261146496815, |
| "grad_norm": 0.2861751317977905, |
| "learning_rate": 0.00019852061683563296, |
| "loss": 2.2769, |
| "mean_token_accuracy": 0.5117324590682983, |
| "num_tokens": 2504378.0, |
| "step": 47 |
| }, |
| { |
| "epoch": 0.6114649681528662, |
| "grad_norm": 0.23169028759002686, |
| "learning_rate": 0.00019841710597877382, |
| "loss": 2.3068, |
| "mean_token_accuracy": 0.5017941743135452, |
| "num_tokens": 2560111.0, |
| "step": 48 |
| }, |
| { |
| "epoch": 0.6242038216560509, |
| "grad_norm": 0.27773961424827576, |
| "learning_rate": 0.00019831012409712737, |
| "loss": 2.2841, |
| "mean_token_accuracy": 0.503075584769249, |
| "num_tokens": 2615347.0, |
| "step": 49 |
| }, |
| { |
| "epoch": 0.6369426751592356, |
| "grad_norm": 0.2665307819843292, |
| "learning_rate": 0.0001981996749637853, |
| "loss": 2.2756, |
| "mean_token_accuracy": 0.5119664669036865, |
| "num_tokens": 2668557.0, |
| "step": 50 |
| }, |
| { |
| "epoch": 0.6496815286624203, |
| "grad_norm": 0.22537562251091003, |
| "learning_rate": 0.0001980857624741241, |
| "loss": 2.2294, |
| "mean_token_accuracy": 0.5203698873519897, |
| "num_tokens": 2719222.0, |
| "step": 51 |
| }, |
| { |
| "epoch": 0.6624203821656051, |
| "grad_norm": 0.25558340549468994, |
| "learning_rate": 0.00019796839064566761, |
| "loss": 2.3334, |
| "mean_token_accuracy": 0.4992421716451645, |
| "num_tokens": 2774066.0, |
| "step": 52 |
| }, |
| { |
| "epoch": 0.6751592356687898, |
| "grad_norm": 0.20945656299591064, |
| "learning_rate": 0.00019784756361794555, |
| "loss": 2.2214, |
| "mean_token_accuracy": 0.517143189907074, |
| "num_tokens": 2826453.0, |
| "step": 53 |
| }, |
| { |
| "epoch": 0.6878980891719745, |
| "grad_norm": 0.23105494678020477, |
| "learning_rate": 0.00019772328565234717, |
| "loss": 2.2567, |
| "mean_token_accuracy": 0.5205609798431396, |
| "num_tokens": 2879916.0, |
| "step": 54 |
| }, |
| { |
| "epoch": 0.7006369426751592, |
| "grad_norm": 0.23229676485061646, |
| "learning_rate": 0.00019759556113197135, |
| "loss": 2.2873, |
| "mean_token_accuracy": 0.5090361982584, |
| "num_tokens": 2935627.0, |
| "step": 55 |
| }, |
| { |
| "epoch": 0.7133757961783439, |
| "grad_norm": 0.2351050078868866, |
| "learning_rate": 0.00019746439456147172, |
| "loss": 2.2766, |
| "mean_token_accuracy": 0.5134994685649872, |
| "num_tokens": 2987299.0, |
| "step": 56 |
| }, |
| { |
| "epoch": 0.7261146496815286, |
| "grad_norm": 0.24870601296424866, |
| "learning_rate": 0.00019732979056689794, |
| "loss": 2.2205, |
| "mean_token_accuracy": 0.522331178188324, |
| "num_tokens": 3039920.0, |
| "step": 57 |
| }, |
| { |
| "epoch": 0.7388535031847133, |
| "grad_norm": 0.28598159551620483, |
| "learning_rate": 0.00019719175389553242, |
| "loss": 2.1919, |
| "mean_token_accuracy": 0.52306267619133, |
| "num_tokens": 3093758.0, |
| "step": 58 |
| }, |
| { |
| "epoch": 0.7515923566878981, |
| "grad_norm": 0.21852071583271027, |
| "learning_rate": 0.00019705028941572307, |
| "loss": 2.2348, |
| "mean_token_accuracy": 0.5180289447307587, |
| "num_tokens": 3146320.0, |
| "step": 59 |
| }, |
| { |
| "epoch": 0.7643312101910829, |
| "grad_norm": 0.3433847427368164, |
| "learning_rate": 0.00019690540211671144, |
| "loss": 2.2131, |
| "mean_token_accuracy": 0.523471474647522, |
| "num_tokens": 3199447.0, |
| "step": 60 |
| }, |
| { |
| "epoch": 0.7770700636942676, |
| "grad_norm": 0.24704255163669586, |
| "learning_rate": 0.00019675709710845687, |
| "loss": 2.2278, |
| "mean_token_accuracy": 0.5203054547309875, |
| "num_tokens": 3249325.0, |
| "step": 61 |
| }, |
| { |
| "epoch": 0.7898089171974523, |
| "grad_norm": 0.2434249073266983, |
| "learning_rate": 0.0001966053796214561, |
| "loss": 2.1922, |
| "mean_token_accuracy": 0.5255579054355621, |
| "num_tokens": 3301933.0, |
| "step": 62 |
| }, |
| { |
| "epoch": 0.802547770700637, |
| "grad_norm": 0.2141779363155365, |
| "learning_rate": 0.00019645025500655906, |
| "loss": 2.3071, |
| "mean_token_accuracy": 0.5049006342887878, |
| "num_tokens": 3359168.0, |
| "step": 63 |
| }, |
| { |
| "epoch": 0.8152866242038217, |
| "grad_norm": 0.2301589697599411, |
| "learning_rate": 0.00019629172873477995, |
| "loss": 2.2495, |
| "mean_token_accuracy": 0.5104150474071503, |
| "num_tokens": 3413805.0, |
| "step": 64 |
| }, |
| { |
| "epoch": 0.8280254777070064, |
| "grad_norm": 0.2124495804309845, |
| "learning_rate": 0.00019612980639710428, |
| "loss": 2.2455, |
| "mean_token_accuracy": 0.5139024257659912, |
| "num_tokens": 3468018.0, |
| "step": 65 |
| }, |
| { |
| "epoch": 0.8407643312101911, |
| "grad_norm": 0.22220134735107422, |
| "learning_rate": 0.00019596449370429183, |
| "loss": 2.1932, |
| "mean_token_accuracy": 0.5238142609596252, |
| "num_tokens": 3520245.0, |
| "step": 66 |
| }, |
| { |
| "epoch": 0.8535031847133758, |
| "grad_norm": 0.2254519909620285, |
| "learning_rate": 0.0001957957964866751, |
| "loss": 2.2676, |
| "mean_token_accuracy": 0.5060286223888397, |
| "num_tokens": 3575996.0, |
| "step": 67 |
| }, |
| { |
| "epoch": 0.8662420382165605, |
| "grad_norm": 0.24107247591018677, |
| "learning_rate": 0.00019562372069395384, |
| "loss": 2.1719, |
| "mean_token_accuracy": 0.529631108045578, |
| "num_tokens": 3626048.0, |
| "step": 68 |
| }, |
| { |
| "epoch": 0.8789808917197452, |
| "grad_norm": 0.233174666762352, |
| "learning_rate": 0.000195448272394985, |
| "loss": 2.2928, |
| "mean_token_accuracy": 0.5004236400127411, |
| "num_tokens": 3680891.0, |
| "step": 69 |
| }, |
| { |
| "epoch": 0.89171974522293, |
| "grad_norm": 0.2761193513870239, |
| "learning_rate": 0.00019526945777756879, |
| "loss": 2.1389, |
| "mean_token_accuracy": 0.5384191572666168, |
| "num_tokens": 3734485.0, |
| "step": 70 |
| }, |
| { |
| "epoch": 0.9044585987261147, |
| "grad_norm": 0.2387181967496872, |
| "learning_rate": 0.00019508728314823062, |
| "loss": 2.2644, |
| "mean_token_accuracy": 0.5090985596179962, |
| "num_tokens": 3788386.0, |
| "step": 71 |
| }, |
| { |
| "epoch": 0.9171974522292994, |
| "grad_norm": 0.2362382709980011, |
| "learning_rate": 0.00019490175493199833, |
| "loss": 2.2815, |
| "mean_token_accuracy": 0.5037011504173279, |
| "num_tokens": 3844848.0, |
| "step": 72 |
| }, |
| { |
| "epoch": 0.9299363057324841, |
| "grad_norm": 0.22168081998825073, |
| "learning_rate": 0.00019471287967217594, |
| "loss": 2.2043, |
| "mean_token_accuracy": 0.5228941738605499, |
| "num_tokens": 3897780.0, |
| "step": 73 |
| }, |
| { |
| "epoch": 0.9426751592356688, |
| "grad_norm": 0.2153845578432083, |
| "learning_rate": 0.00019452066403011253, |
| "loss": 2.2061, |
| "mean_token_accuracy": 0.521478921175003, |
| "num_tokens": 3951508.0, |
| "step": 74 |
| }, |
| { |
| "epoch": 0.9554140127388535, |
| "grad_norm": 0.2467203289270401, |
| "learning_rate": 0.00019432511478496768, |
| "loss": 2.2269, |
| "mean_token_accuracy": 0.5161807537078857, |
| "num_tokens": 4005526.0, |
| "step": 75 |
| }, |
| { |
| "epoch": 0.9681528662420382, |
| "grad_norm": 0.2676069140434265, |
| "learning_rate": 0.00019412623883347207, |
| "loss": 2.2885, |
| "mean_token_accuracy": 0.5052478164434433, |
| "num_tokens": 4060883.0, |
| "step": 76 |
| }, |
| { |
| "epoch": 0.9808917197452229, |
| "grad_norm": 0.3622201979160309, |
| "learning_rate": 0.0001939240431896844, |
| "loss": 2.2456, |
| "mean_token_accuracy": 0.513193815946579, |
| "num_tokens": 4116720.0, |
| "step": 77 |
| }, |
| { |
| "epoch": 0.9936305732484076, |
| "grad_norm": 0.28581345081329346, |
| "learning_rate": 0.0001937185349847439, |
| "loss": 2.2372, |
| "mean_token_accuracy": 0.5164882987737656, |
| "num_tokens": 4171909.0, |
| "step": 78 |
| }, |
| { |
| "epoch": 1.0, |
| "grad_norm": 0.28581345081329346, |
| "learning_rate": 0.00019350972146661905, |
| "loss": 2.2208, |
| "mean_token_accuracy": 0.5214709043502808, |
| "num_tokens": 4196905.0, |
| "step": 79 |
| }, |
| { |
| "epoch": 1.0127388535031847, |
| "grad_norm": 0.4009493887424469, |
| "learning_rate": 0.00019329760999985167, |
| "loss": 2.1636, |
| "mean_token_accuracy": 0.5267406105995178, |
| "num_tokens": 4250007.0, |
| "step": 80 |
| }, |
| { |
| "epoch": 1.0254777070063694, |
| "grad_norm": 0.43694907426834106, |
| "learning_rate": 0.00019308220806529738, |
| "loss": 2.1002, |
| "mean_token_accuracy": 0.5409376621246338, |
| "num_tokens": 4301240.0, |
| "step": 81 |
| }, |
| { |
| "epoch": 1.0382165605095541, |
| "grad_norm": 0.2592337429523468, |
| "learning_rate": 0.00019286352325986164, |
| "loss": 2.1344, |
| "mean_token_accuracy": 0.5298282206058502, |
| "num_tokens": 4355550.0, |
| "step": 82 |
| }, |
| { |
| "epoch": 1.0509554140127388, |
| "grad_norm": 0.3665807545185089, |
| "learning_rate": 0.00019264156329623197, |
| "loss": 2.1566, |
| "mean_token_accuracy": 0.531202495098114, |
| "num_tokens": 4409847.0, |
| "step": 83 |
| }, |
| { |
| "epoch": 1.0636942675159236, |
| "grad_norm": 0.3309776186943054, |
| "learning_rate": 0.00019241633600260578, |
| "loss": 2.064, |
| "mean_token_accuracy": 0.5411050617694855, |
| "num_tokens": 4462400.0, |
| "step": 84 |
| }, |
| { |
| "epoch": 1.0764331210191083, |
| "grad_norm": 0.33778995275497437, |
| "learning_rate": 0.00019218784932241434, |
| "loss": 2.0934, |
| "mean_token_accuracy": 0.5414632260799408, |
| "num_tokens": 4514701.0, |
| "step": 85 |
| }, |
| { |
| "epoch": 1.089171974522293, |
| "grad_norm": 0.30230894684791565, |
| "learning_rate": 0.0001919561113140427, |
| "loss": 2.0989, |
| "mean_token_accuracy": 0.5322273671627045, |
| "num_tokens": 4568775.0, |
| "step": 86 |
| }, |
| { |
| "epoch": 1.1019108280254777, |
| "grad_norm": 0.2423592060804367, |
| "learning_rate": 0.00019172113015054532, |
| "loss": 2.0923, |
| "mean_token_accuracy": 0.5353631675243378, |
| "num_tokens": 4620587.0, |
| "step": 87 |
| }, |
| { |
| "epoch": 1.1146496815286624, |
| "grad_norm": 0.3683182895183563, |
| "learning_rate": 0.00019148291411935796, |
| "loss": 2.1053, |
| "mean_token_accuracy": 0.5336830317974091, |
| "num_tokens": 4673238.0, |
| "step": 88 |
| }, |
| { |
| "epoch": 1.127388535031847, |
| "grad_norm": 0.2518496811389923, |
| "learning_rate": 0.00019124147162200535, |
| "loss": 2.0822, |
| "mean_token_accuracy": 0.540095865726471, |
| "num_tokens": 4725246.0, |
| "step": 89 |
| }, |
| { |
| "epoch": 1.1401273885350318, |
| "grad_norm": 0.25359344482421875, |
| "learning_rate": 0.00019099681117380486, |
| "loss": 2.1159, |
| "mean_token_accuracy": 0.5306004583835602, |
| "num_tokens": 4783484.0, |
| "step": 90 |
| }, |
| { |
| "epoch": 1.1528662420382165, |
| "grad_norm": 0.2729495167732239, |
| "learning_rate": 0.00019074894140356624, |
| "loss": 2.1016, |
| "mean_token_accuracy": 0.5280826091766357, |
| "num_tokens": 4839119.0, |
| "step": 91 |
| }, |
| { |
| "epoch": 1.1656050955414012, |
| "grad_norm": 0.2338961809873581, |
| "learning_rate": 0.00019049787105328715, |
| "loss": 2.0787, |
| "mean_token_accuracy": 0.5392454266548157, |
| "num_tokens": 4891499.0, |
| "step": 92 |
| }, |
| { |
| "epoch": 1.178343949044586, |
| "grad_norm": 0.25005510449409485, |
| "learning_rate": 0.00019024360897784508, |
| "loss": 2.1355, |
| "mean_token_accuracy": 0.5308442413806915, |
| "num_tokens": 4945849.0, |
| "step": 93 |
| }, |
| { |
| "epoch": 1.1910828025477707, |
| "grad_norm": 0.2686973214149475, |
| "learning_rate": 0.00018998616414468478, |
| "loss": 2.0928, |
| "mean_token_accuracy": 0.5372393429279327, |
| "num_tokens": 5002303.0, |
| "step": 94 |
| }, |
| { |
| "epoch": 1.2038216560509554, |
| "grad_norm": 0.2296302765607834, |
| "learning_rate": 0.0001897255456335022, |
| "loss": 2.0734, |
| "mean_token_accuracy": 0.5390827655792236, |
| "num_tokens": 5054582.0, |
| "step": 95 |
| }, |
| { |
| "epoch": 1.21656050955414, |
| "grad_norm": 0.24622996151447296, |
| "learning_rate": 0.0001894617626359242, |
| "loss": 2.0855, |
| "mean_token_accuracy": 0.5394154489040375, |
| "num_tokens": 5105256.0, |
| "step": 96 |
| }, |
| { |
| "epoch": 1.2292993630573248, |
| "grad_norm": 0.29459571838378906, |
| "learning_rate": 0.00018919482445518436, |
| "loss": 2.0786, |
| "mean_token_accuracy": 0.5413715243339539, |
| "num_tokens": 5160210.0, |
| "step": 97 |
| }, |
| { |
| "epoch": 1.2420382165605095, |
| "grad_norm": 0.25291192531585693, |
| "learning_rate": 0.0001889247405057948, |
| "loss": 2.1601, |
| "mean_token_accuracy": 0.5215615034103394, |
| "num_tokens": 5214515.0, |
| "step": 98 |
| }, |
| { |
| "epoch": 1.2547770700636942, |
| "grad_norm": 0.2828863561153412, |
| "learning_rate": 0.00018865152031321427, |
| "loss": 2.0636, |
| "mean_token_accuracy": 0.5417250990867615, |
| "num_tokens": 5270473.0, |
| "step": 99 |
| }, |
| { |
| "epoch": 1.267515923566879, |
| "grad_norm": 0.24130484461784363, |
| "learning_rate": 0.00018837517351351214, |
| "loss": 2.1423, |
| "mean_token_accuracy": 0.533792644739151, |
| "num_tokens": 5325465.0, |
| "step": 100 |
| }, |
| { |
| "epoch": 1.2802547770700636, |
| "grad_norm": 0.26588988304138184, |
| "learning_rate": 0.00018809570985302862, |
| "loss": 2.1106, |
| "mean_token_accuracy": 0.5345290303230286, |
| "num_tokens": 5378975.0, |
| "step": 101 |
| }, |
| { |
| "epoch": 1.2929936305732483, |
| "grad_norm": 0.23804686963558197, |
| "learning_rate": 0.00018781313918803086, |
| "loss": 2.0467, |
| "mean_token_accuracy": 0.5438741445541382, |
| "num_tokens": 5429881.0, |
| "step": 102 |
| }, |
| { |
| "epoch": 1.305732484076433, |
| "grad_norm": 0.3126032054424286, |
| "learning_rate": 0.00018752747148436543, |
| "loss": 2.1516, |
| "mean_token_accuracy": 0.5253174304962158, |
| "num_tokens": 5483872.0, |
| "step": 103 |
| }, |
| { |
| "epoch": 1.3184713375796178, |
| "grad_norm": 0.25495046377182007, |
| "learning_rate": 0.00018723871681710697, |
| "loss": 2.1359, |
| "mean_token_accuracy": 0.5270724594593048, |
| "num_tokens": 5538427.0, |
| "step": 104 |
| }, |
| { |
| "epoch": 1.3312101910828025, |
| "grad_norm": 0.30238616466522217, |
| "learning_rate": 0.0001869468853702026, |
| "loss": 2.0455, |
| "mean_token_accuracy": 0.5438694357872009, |
| "num_tokens": 5588718.0, |
| "step": 105 |
| }, |
| { |
| "epoch": 1.3439490445859872, |
| "grad_norm": 0.2548542618751526, |
| "learning_rate": 0.0001866519874361129, |
| "loss": 2.1926, |
| "mean_token_accuracy": 0.5167091488838196, |
| "num_tokens": 5646062.0, |
| "step": 106 |
| }, |
| { |
| "epoch": 1.356687898089172, |
| "grad_norm": 0.3424091935157776, |
| "learning_rate": 0.000186354033415449, |
| "loss": 2.0662, |
| "mean_token_accuracy": 0.536639928817749, |
| "num_tokens": 5699150.0, |
| "step": 107 |
| }, |
| { |
| "epoch": 1.3694267515923566, |
| "grad_norm": 0.24927005171775818, |
| "learning_rate": 0.00018605303381660543, |
| "loss": 2.1148, |
| "mean_token_accuracy": 0.5341704487800598, |
| "num_tokens": 5752117.0, |
| "step": 108 |
| }, |
| { |
| "epoch": 1.3821656050955413, |
| "grad_norm": 0.29815709590911865, |
| "learning_rate": 0.00018574899925538998, |
| "loss": 2.0293, |
| "mean_token_accuracy": 0.547461211681366, |
| "num_tokens": 5805733.0, |
| "step": 109 |
| }, |
| { |
| "epoch": 1.394904458598726, |
| "grad_norm": 0.23644262552261353, |
| "learning_rate": 0.00018544194045464886, |
| "loss": 2.1122, |
| "mean_token_accuracy": 0.532728523015976, |
| "num_tokens": 5857780.0, |
| "step": 110 |
| }, |
| { |
| "epoch": 1.4076433121019107, |
| "grad_norm": 0.3198355436325073, |
| "learning_rate": 0.00018513186824388879, |
| "loss": 2.0444, |
| "mean_token_accuracy": 0.5452798306941986, |
| "num_tokens": 5909706.0, |
| "step": 111 |
| }, |
| { |
| "epoch": 1.4203821656050954, |
| "grad_norm": 0.2513161301612854, |
| "learning_rate": 0.00018481879355889495, |
| "loss": 2.0679, |
| "mean_token_accuracy": 0.5424592792987823, |
| "num_tokens": 5963429.0, |
| "step": 112 |
| }, |
| { |
| "epoch": 1.4331210191082802, |
| "grad_norm": 0.2995910048484802, |
| "learning_rate": 0.00018450272744134532, |
| "loss": 2.0992, |
| "mean_token_accuracy": 0.5330868661403656, |
| "num_tokens": 6018349.0, |
| "step": 113 |
| }, |
| { |
| "epoch": 1.4458598726114649, |
| "grad_norm": 0.26617002487182617, |
| "learning_rate": 0.00018418368103842125, |
| "loss": 2.0859, |
| "mean_token_accuracy": 0.5419372916221619, |
| "num_tokens": 6071380.0, |
| "step": 114 |
| }, |
| { |
| "epoch": 1.4585987261146496, |
| "grad_norm": 0.2854417860507965, |
| "learning_rate": 0.00018386166560241434, |
| "loss": 2.0102, |
| "mean_token_accuracy": 0.5525364279747009, |
| "num_tokens": 6122148.0, |
| "step": 115 |
| }, |
| { |
| "epoch": 1.4713375796178343, |
| "grad_norm": 0.25919023156166077, |
| "learning_rate": 0.0001835366924903295, |
| "loss": 2.0898, |
| "mean_token_accuracy": 0.5407845079898834, |
| "num_tokens": 6177776.0, |
| "step": 116 |
| }, |
| { |
| "epoch": 1.484076433121019, |
| "grad_norm": 0.28204745054244995, |
| "learning_rate": 0.00018320877316348454, |
| "loss": 2.076, |
| "mean_token_accuracy": 0.5413212180137634, |
| "num_tokens": 6226607.0, |
| "step": 117 |
| }, |
| { |
| "epoch": 1.4968152866242037, |
| "grad_norm": 0.25847408175468445, |
| "learning_rate": 0.00018287791918710587, |
| "loss": 2.1751, |
| "mean_token_accuracy": 0.5201755166053772, |
| "num_tokens": 6282972.0, |
| "step": 118 |
| }, |
| { |
| "epoch": 1.5095541401273884, |
| "grad_norm": 0.26896369457244873, |
| "learning_rate": 0.0001825441422299206, |
| "loss": 2.1031, |
| "mean_token_accuracy": 0.5321025848388672, |
| "num_tokens": 6337308.0, |
| "step": 119 |
| }, |
| { |
| "epoch": 1.5222929936305731, |
| "grad_norm": 0.2460022270679474, |
| "learning_rate": 0.00018220745406374498, |
| "loss": 2.0567, |
| "mean_token_accuracy": 0.5367059409618378, |
| "num_tokens": 6392544.0, |
| "step": 120 |
| }, |
| { |
| "epoch": 1.5350318471337578, |
| "grad_norm": 0.2766154706478119, |
| "learning_rate": 0.00018186786656306935, |
| "loss": 2.0692, |
| "mean_token_accuracy": 0.5417434871196747, |
| "num_tokens": 6445611.0, |
| "step": 121 |
| }, |
| { |
| "epoch": 1.5477707006369426, |
| "grad_norm": 0.2518499493598938, |
| "learning_rate": 0.00018152539170463925, |
| "loss": 2.1262, |
| "mean_token_accuracy": 0.5296519994735718, |
| "num_tokens": 6500225.0, |
| "step": 122 |
| }, |
| { |
| "epoch": 1.5605095541401273, |
| "grad_norm": 0.28496435284614563, |
| "learning_rate": 0.00018118004156703296, |
| "loss": 2.1254, |
| "mean_token_accuracy": 0.526570588350296, |
| "num_tokens": 6553560.0, |
| "step": 123 |
| }, |
| { |
| "epoch": 1.573248407643312, |
| "grad_norm": 0.2789745628833771, |
| "learning_rate": 0.00018083182833023562, |
| "loss": 1.9918, |
| "mean_token_accuracy": 0.5569777488708496, |
| "num_tokens": 6603384.0, |
| "step": 124 |
| }, |
| { |
| "epoch": 1.5859872611464967, |
| "grad_norm": 0.25823691487312317, |
| "learning_rate": 0.0001804807642752096, |
| "loss": 2.0228, |
| "mean_token_accuracy": 0.5478627681732178, |
| "num_tokens": 6656526.0, |
| "step": 125 |
| }, |
| { |
| "epoch": 1.5987261146496814, |
| "grad_norm": 0.2591652274131775, |
| "learning_rate": 0.00018012686178346142, |
| "loss": 2.1509, |
| "mean_token_accuracy": 0.5273606777191162, |
| "num_tokens": 6709576.0, |
| "step": 126 |
| }, |
| { |
| "epoch": 1.611464968152866, |
| "grad_norm": 0.2391829490661621, |
| "learning_rate": 0.000179770133336605, |
| "loss": 2.1213, |
| "mean_token_accuracy": 0.5313501060009003, |
| "num_tokens": 6765322.0, |
| "step": 127 |
| }, |
| { |
| "epoch": 1.6242038216560508, |
| "grad_norm": 0.2610240876674652, |
| "learning_rate": 0.00017941059151592147, |
| "loss": 2.051, |
| "mean_token_accuracy": 0.54247185587883, |
| "num_tokens": 6819147.0, |
| "step": 128 |
| }, |
| { |
| "epoch": 1.6369426751592355, |
| "grad_norm": 0.24574102461338043, |
| "learning_rate": 0.00017904824900191556, |
| "loss": 2.0438, |
| "mean_token_accuracy": 0.5455809235572815, |
| "num_tokens": 6871157.0, |
| "step": 129 |
| }, |
| { |
| "epoch": 1.6496815286624202, |
| "grad_norm": 0.2546396255493164, |
| "learning_rate": 0.0001786831185738682, |
| "loss": 2.0698, |
| "mean_token_accuracy": 0.539449006319046, |
| "num_tokens": 6924990.0, |
| "step": 130 |
| }, |
| { |
| "epoch": 1.662420382165605, |
| "grad_norm": 0.29086804389953613, |
| "learning_rate": 0.0001783152131093859, |
| "loss": 2.118, |
| "mean_token_accuracy": 0.5345580279827118, |
| "num_tokens": 6978266.0, |
| "step": 131 |
| }, |
| { |
| "epoch": 1.6751592356687897, |
| "grad_norm": 0.37763142585754395, |
| "learning_rate": 0.00017794454558394657, |
| "loss": 1.9885, |
| "mean_token_accuracy": 0.5575284659862518, |
| "num_tokens": 7029787.0, |
| "step": 132 |
| }, |
| { |
| "epoch": 1.6878980891719744, |
| "grad_norm": 0.32433372735977173, |
| "learning_rate": 0.000177571129070442, |
| "loss": 2.0462, |
| "mean_token_accuracy": 0.5397576093673706, |
| "num_tokens": 7081794.0, |
| "step": 133 |
| }, |
| { |
| "epoch": 1.700636942675159, |
| "grad_norm": 0.24215054512023926, |
| "learning_rate": 0.00017719497673871653, |
| "loss": 2.1465, |
| "mean_token_accuracy": 0.5300171673297882, |
| "num_tokens": 7135693.0, |
| "step": 134 |
| }, |
| { |
| "epoch": 1.7133757961783438, |
| "grad_norm": 0.2703648805618286, |
| "learning_rate": 0.00017681610185510285, |
| "loss": 2.0875, |
| "mean_token_accuracy": 0.5355214774608612, |
| "num_tokens": 7189079.0, |
| "step": 135 |
| }, |
| { |
| "epoch": 1.7261146496815285, |
| "grad_norm": 0.2528088390827179, |
| "learning_rate": 0.00017643451778195395, |
| "loss": 2.0384, |
| "mean_token_accuracy": 0.5461491942405701, |
| "num_tokens": 7243102.0, |
| "step": 136 |
| }, |
| { |
| "epoch": 1.7388535031847132, |
| "grad_norm": 0.3094780445098877, |
| "learning_rate": 0.00017605023797717195, |
| "loss": 2.0923, |
| "mean_token_accuracy": 0.5363390445709229, |
| "num_tokens": 7299401.0, |
| "step": 137 |
| }, |
| { |
| "epoch": 1.7515923566878981, |
| "grad_norm": 0.28315144777297974, |
| "learning_rate": 0.00017566327599373338, |
| "loss": 2.0433, |
| "mean_token_accuracy": 0.5426464676856995, |
| "num_tokens": 7353711.0, |
| "step": 138 |
| }, |
| { |
| "epoch": 1.7643312101910829, |
| "grad_norm": 0.24867816269397736, |
| "learning_rate": 0.0001752736454792112, |
| "loss": 2.0688, |
| "mean_token_accuracy": 0.5372464060783386, |
| "num_tokens": 7408006.0, |
| "step": 139 |
| }, |
| { |
| "epoch": 1.7770700636942676, |
| "grad_norm": 0.26247575879096985, |
| "learning_rate": 0.0001748813601752935, |
| "loss": 2.0498, |
| "mean_token_accuracy": 0.5413098931312561, |
| "num_tokens": 7457359.0, |
| "step": 140 |
| }, |
| { |
| "epoch": 1.7898089171974523, |
| "grad_norm": 0.2658616602420807, |
| "learning_rate": 0.00017448643391729888, |
| "loss": 2.0639, |
| "mean_token_accuracy": 0.5411241352558136, |
| "num_tokens": 7511249.0, |
| "step": 141 |
| }, |
| { |
| "epoch": 1.802547770700637, |
| "grad_norm": 0.26161476969718933, |
| "learning_rate": 0.0001740888806336884, |
| "loss": 1.9642, |
| "mean_token_accuracy": 0.5591636896133423, |
| "num_tokens": 7563517.0, |
| "step": 142 |
| }, |
| { |
| "epoch": 1.8152866242038217, |
| "grad_norm": 0.27942124009132385, |
| "learning_rate": 0.00017368871434557447, |
| "loss": 2.0316, |
| "mean_token_accuracy": 0.5493811964988708, |
| "num_tokens": 7617931.0, |
| "step": 143 |
| }, |
| { |
| "epoch": 1.8280254777070064, |
| "grad_norm": 0.27375614643096924, |
| "learning_rate": 0.00017328594916622616, |
| "loss": 2.1429, |
| "mean_token_accuracy": 0.5267685651779175, |
| "num_tokens": 7673112.0, |
| "step": 144 |
| }, |
| { |
| "epoch": 1.8407643312101911, |
| "grad_norm": 0.254905641078949, |
| "learning_rate": 0.00017288059930057166, |
| "loss": 2.0156, |
| "mean_token_accuracy": 0.5502710938453674, |
| "num_tokens": 7724812.0, |
| "step": 145 |
| }, |
| { |
| "epoch": 1.8535031847133758, |
| "grad_norm": 0.351695716381073, |
| "learning_rate": 0.00017247267904469725, |
| "loss": 2.0889, |
| "mean_token_accuracy": 0.5358254015445709, |
| "num_tokens": 7778602.0, |
| "step": 146 |
| }, |
| { |
| "epoch": 1.8662420382165605, |
| "grad_norm": 0.4778117835521698, |
| "learning_rate": 0.00017206220278534286, |
| "loss": 2.0909, |
| "mean_token_accuracy": 0.5361159443855286, |
| "num_tokens": 7834315.0, |
| "step": 147 |
| }, |
| { |
| "epoch": 1.8789808917197452, |
| "grad_norm": 0.4126635193824768, |
| "learning_rate": 0.00017164918499939504, |
| "loss": 2.0449, |
| "mean_token_accuracy": 0.5419832766056061, |
| "num_tokens": 7889504.0, |
| "step": 148 |
| }, |
| { |
| "epoch": 1.89171974522293, |
| "grad_norm": 0.24908094108104706, |
| "learning_rate": 0.0001712336402533761, |
| "loss": 2.0865, |
| "mean_token_accuracy": 0.5369491875171661, |
| "num_tokens": 7942973.0, |
| "step": 149 |
| }, |
| { |
| "epoch": 1.9044585987261147, |
| "grad_norm": 0.3111526370048523, |
| "learning_rate": 0.00017081558320293055, |
| "loss": 2.0669, |
| "mean_token_accuracy": 0.5396228730678558, |
| "num_tokens": 7996262.0, |
| "step": 150 |
| }, |
| { |
| "epoch": 1.9171974522292994, |
| "grad_norm": 0.2583426833152771, |
| "learning_rate": 0.000170395028592308, |
| "loss": 2.0325, |
| "mean_token_accuracy": 0.5466030538082123, |
| "num_tokens": 8049642.0, |
| "step": 151 |
| }, |
| { |
| "epoch": 1.929936305732484, |
| "grad_norm": 0.2781616747379303, |
| "learning_rate": 0.00016997199125384343, |
| "loss": 2.0315, |
| "mean_token_accuracy": 0.5470220148563385, |
| "num_tokens": 8098814.0, |
| "step": 152 |
| }, |
| { |
| "epoch": 1.9426751592356688, |
| "grad_norm": 0.24786719679832458, |
| "learning_rate": 0.00016954648610743384, |
| "loss": 2.019, |
| "mean_token_accuracy": 0.5468859374523163, |
| "num_tokens": 8153236.0, |
| "step": 153 |
| }, |
| { |
| "epoch": 1.9554140127388535, |
| "grad_norm": 0.28360286355018616, |
| "learning_rate": 0.0001691185281600122, |
| "loss": 2.0041, |
| "mean_token_accuracy": 0.5581452548503876, |
| "num_tokens": 8202533.0, |
| "step": 154 |
| }, |
| { |
| "epoch": 1.9681528662420382, |
| "grad_norm": 0.2584933638572693, |
| "learning_rate": 0.0001686881325050181, |
| "loss": 2.0896, |
| "mean_token_accuracy": 0.5383184850215912, |
| "num_tokens": 8258282.0, |
| "step": 155 |
| }, |
| { |
| "epoch": 1.980891719745223, |
| "grad_norm": 0.26692625880241394, |
| "learning_rate": 0.00016825531432186543, |
| "loss": 2.1362, |
| "mean_token_accuracy": 0.5277881026268005, |
| "num_tokens": 8314231.0, |
| "step": 156 |
| }, |
| { |
| "epoch": 1.9936305732484076, |
| "grad_norm": 0.2702077627182007, |
| "learning_rate": 0.00016782008887540704, |
| "loss": 2.0413, |
| "mean_token_accuracy": 0.5440081357955933, |
| "num_tokens": 8367791.0, |
| "step": 157 |
| }, |
| { |
| "epoch": 2.0, |
| "grad_norm": 0.4807445704936981, |
| "learning_rate": 0.00016738247151539643, |
| "loss": 2.0135, |
| "mean_token_accuracy": 0.5475367307662964, |
| "num_tokens": 8394718.0, |
| "step": 158 |
| }, |
| { |
| "epoch": 2.0127388535031847, |
| "grad_norm": 0.3290596306324005, |
| "learning_rate": 0.00016694247767594624, |
| "loss": 1.918, |
| "mean_token_accuracy": 0.5643911361694336, |
| "num_tokens": 8448629.0, |
| "step": 159 |
| }, |
| { |
| "epoch": 2.0254777070063694, |
| "grad_norm": 0.32206520438194275, |
| "learning_rate": 0.00016650012287498412, |
| "loss": 1.8948, |
| "mean_token_accuracy": 0.5651561915874481, |
| "num_tokens": 8500589.0, |
| "step": 160 |
| }, |
| { |
| "epoch": 2.038216560509554, |
| "grad_norm": 0.481879323720932, |
| "learning_rate": 0.00016605542271370513, |
| "loss": 1.8746, |
| "mean_token_accuracy": 0.5729745626449585, |
| "num_tokens": 8553721.0, |
| "step": 161 |
| }, |
| { |
| "epoch": 2.050955414012739, |
| "grad_norm": 0.30145731568336487, |
| "learning_rate": 0.00016560839287602192, |
| "loss": 1.9552, |
| "mean_token_accuracy": 0.5494319200515747, |
| "num_tokens": 8607953.0, |
| "step": 162 |
| }, |
| { |
| "epoch": 2.0636942675159236, |
| "grad_norm": 0.43942347168922424, |
| "learning_rate": 0.00016515904912801118, |
| "loss": 1.8665, |
| "mean_token_accuracy": 0.5666735470294952, |
| "num_tokens": 8660147.0, |
| "step": 163 |
| }, |
| { |
| "epoch": 2.0764331210191083, |
| "grad_norm": 0.3917507827281952, |
| "learning_rate": 0.00016470740731735787, |
| "loss": 1.8992, |
| "mean_token_accuracy": 0.5648495852947235, |
| "num_tokens": 8716453.0, |
| "step": 164 |
| }, |
| { |
| "epoch": 2.089171974522293, |
| "grad_norm": 0.3952564597129822, |
| "learning_rate": 0.0001642534833727962, |
| "loss": 1.8559, |
| "mean_token_accuracy": 0.5734367072582245, |
| "num_tokens": 8771996.0, |
| "step": 165 |
| }, |
| { |
| "epoch": 2.1019108280254777, |
| "grad_norm": 0.3962686359882355, |
| "learning_rate": 0.00016379729330354774, |
| "loss": 1.8981, |
| "mean_token_accuracy": 0.5651469826698303, |
| "num_tokens": 8825604.0, |
| "step": 166 |
| }, |
| { |
| "epoch": 2.1146496815286624, |
| "grad_norm": 0.39561396837234497, |
| "learning_rate": 0.00016333885319875702, |
| "loss": 1.7526, |
| "mean_token_accuracy": 0.5901646912097931, |
| "num_tokens": 8875536.0, |
| "step": 167 |
| }, |
| { |
| "epoch": 2.127388535031847, |
| "grad_norm": 0.34546512365341187, |
| "learning_rate": 0.00016287817922692395, |
| "loss": 1.8376, |
| "mean_token_accuracy": 0.5775989890098572, |
| "num_tokens": 8926512.0, |
| "step": 168 |
| }, |
| { |
| "epoch": 2.140127388535032, |
| "grad_norm": 0.3792065382003784, |
| "learning_rate": 0.00016241528763533353, |
| "loss": 1.8578, |
| "mean_token_accuracy": 0.5747014582157135, |
| "num_tokens": 8981202.0, |
| "step": 169 |
| }, |
| { |
| "epoch": 2.1528662420382165, |
| "grad_norm": 0.30425429344177246, |
| "learning_rate": 0.00016195019474948299, |
| "loss": 1.8028, |
| "mean_token_accuracy": 0.5819543302059174, |
| "num_tokens": 9036791.0, |
| "step": 170 |
| }, |
| { |
| "epoch": 2.1656050955414012, |
| "grad_norm": 0.3416166603565216, |
| "learning_rate": 0.00016148291697250594, |
| "loss": 1.8448, |
| "mean_token_accuracy": 0.5725643932819366, |
| "num_tokens": 9087595.0, |
| "step": 171 |
| }, |
| { |
| "epoch": 2.178343949044586, |
| "grad_norm": 0.337971031665802, |
| "learning_rate": 0.00016101347078459373, |
| "loss": 1.888, |
| "mean_token_accuracy": 0.5669349431991577, |
| "num_tokens": 9140895.0, |
| "step": 172 |
| }, |
| { |
| "epoch": 2.1910828025477707, |
| "grad_norm": 0.30838721990585327, |
| "learning_rate": 0.0001605418727424145, |
| "loss": 1.8256, |
| "mean_token_accuracy": 0.5793758928775787, |
| "num_tokens": 9194795.0, |
| "step": 173 |
| }, |
| { |
| "epoch": 2.2038216560509554, |
| "grad_norm": 0.35549449920654297, |
| "learning_rate": 0.00016006813947852893, |
| "loss": 1.9405, |
| "mean_token_accuracy": 0.5567865371704102, |
| "num_tokens": 9248301.0, |
| "step": 174 |
| }, |
| { |
| "epoch": 2.21656050955414, |
| "grad_norm": 0.31602397561073303, |
| "learning_rate": 0.0001595922877008039, |
| "loss": 1.8156, |
| "mean_token_accuracy": 0.5829095840454102, |
| "num_tokens": 9301295.0, |
| "step": 175 |
| }, |
| { |
| "epoch": 2.229299363057325, |
| "grad_norm": 0.3251636028289795, |
| "learning_rate": 0.00015911433419182305, |
| "loss": 1.721, |
| "mean_token_accuracy": 0.6002079248428345, |
| "num_tokens": 9354095.0, |
| "step": 176 |
| }, |
| { |
| "epoch": 2.2420382165605095, |
| "grad_norm": 0.33418506383895874, |
| "learning_rate": 0.000158634295808295, |
| "loss": 1.9674, |
| "mean_token_accuracy": 0.5512142181396484, |
| "num_tokens": 9407606.0, |
| "step": 177 |
| }, |
| { |
| "epoch": 2.254777070063694, |
| "grad_norm": 0.3153228461742401, |
| "learning_rate": 0.00015815218948045878, |
| "loss": 1.8918, |
| "mean_token_accuracy": 0.5645856559276581, |
| "num_tokens": 9461511.0, |
| "step": 178 |
| }, |
| { |
| "epoch": 2.267515923566879, |
| "grad_norm": 0.3489258289337158, |
| "learning_rate": 0.00015766803221148673, |
| "loss": 1.797, |
| "mean_token_accuracy": 0.5782068967819214, |
| "num_tokens": 9516458.0, |
| "step": 179 |
| }, |
| { |
| "epoch": 2.2802547770700636, |
| "grad_norm": 0.3235794007778168, |
| "learning_rate": 0.0001571818410768848, |
| "loss": 1.8385, |
| "mean_token_accuracy": 0.576362818479538, |
| "num_tokens": 9566696.0, |
| "step": 180 |
| }, |
| { |
| "epoch": 2.2929936305732483, |
| "grad_norm": 0.33087673783302307, |
| "learning_rate": 0.0001566936332238904, |
| "loss": 1.7875, |
| "mean_token_accuracy": 0.5848988592624664, |
| "num_tokens": 9616804.0, |
| "step": 181 |
| }, |
| { |
| "epoch": 2.305732484076433, |
| "grad_norm": 0.36274445056915283, |
| "learning_rate": 0.0001562034258708676, |
| "loss": 1.8841, |
| "mean_token_accuracy": 0.5680437088012695, |
| "num_tokens": 9670221.0, |
| "step": 182 |
| }, |
| { |
| "epoch": 2.3184713375796178, |
| "grad_norm": 0.3127928078174591, |
| "learning_rate": 0.0001557112363066998, |
| "loss": 1.9593, |
| "mean_token_accuracy": 0.5503961145877838, |
| "num_tokens": 9726367.0, |
| "step": 183 |
| }, |
| { |
| "epoch": 2.3312101910828025, |
| "grad_norm": 0.364726722240448, |
| "learning_rate": 0.00015521708189018005, |
| "loss": 1.8904, |
| "mean_token_accuracy": 0.5647120475769043, |
| "num_tokens": 9780523.0, |
| "step": 184 |
| }, |
| { |
| "epoch": 2.343949044585987, |
| "grad_norm": 0.3284487724304199, |
| "learning_rate": 0.00015472098004939888, |
| "loss": 1.8814, |
| "mean_token_accuracy": 0.5700592994689941, |
| "num_tokens": 9836267.0, |
| "step": 185 |
| }, |
| { |
| "epoch": 2.356687898089172, |
| "grad_norm": 0.3258507251739502, |
| "learning_rate": 0.00015422294828112954, |
| "loss": 1.8982, |
| "mean_token_accuracy": 0.5598087012767792, |
| "num_tokens": 9891684.0, |
| "step": 186 |
| }, |
| { |
| "epoch": 2.3694267515923566, |
| "grad_norm": 0.3135438561439514, |
| "learning_rate": 0.00015372300415021091, |
| "loss": 1.8623, |
| "mean_token_accuracy": 0.5698948800563812, |
| "num_tokens": 9944113.0, |
| "step": 187 |
| }, |
| { |
| "epoch": 2.3821656050955413, |
| "grad_norm": 0.31163397431373596, |
| "learning_rate": 0.00015322116528892807, |
| "loss": 1.8826, |
| "mean_token_accuracy": 0.5662359297275543, |
| "num_tokens": 9998424.0, |
| "step": 188 |
| }, |
| { |
| "epoch": 2.394904458598726, |
| "grad_norm": 0.33179372549057007, |
| "learning_rate": 0.0001527174493963905, |
| "loss": 1.8688, |
| "mean_token_accuracy": 0.5694395303726196, |
| "num_tokens": 10052249.0, |
| "step": 189 |
| }, |
| { |
| "epoch": 2.4076433121019107, |
| "grad_norm": 0.30368921160697937, |
| "learning_rate": 0.0001522118742379076, |
| "loss": 1.959, |
| "mean_token_accuracy": 0.55058753490448, |
| "num_tokens": 10107567.0, |
| "step": 190 |
| }, |
| { |
| "epoch": 2.4203821656050954, |
| "grad_norm": 0.3139498829841614, |
| "learning_rate": 0.00015170445764436252, |
| "loss": 1.7924, |
| "mean_token_accuracy": 0.5893403887748718, |
| "num_tokens": 10160504.0, |
| "step": 191 |
| }, |
| { |
| "epoch": 2.43312101910828, |
| "grad_norm": 0.322956919670105, |
| "learning_rate": 0.00015119521751158296, |
| "loss": 1.8052, |
| "mean_token_accuracy": 0.5783436894416809, |
| "num_tokens": 10215055.0, |
| "step": 192 |
| }, |
| { |
| "epoch": 2.445859872611465, |
| "grad_norm": 0.3144392669200897, |
| "learning_rate": 0.00015068417179971014, |
| "loss": 1.8844, |
| "mean_token_accuracy": 0.5616180300712585, |
| "num_tokens": 10268601.0, |
| "step": 193 |
| }, |
| { |
| "epoch": 2.4585987261146496, |
| "grad_norm": 0.3140745162963867, |
| "learning_rate": 0.00015017133853256537, |
| "loss": 1.8831, |
| "mean_token_accuracy": 0.567226380109787, |
| "num_tokens": 10323920.0, |
| "step": 194 |
| }, |
| { |
| "epoch": 2.4713375796178343, |
| "grad_norm": 0.31903892755508423, |
| "learning_rate": 0.00014965673579701445, |
| "loss": 1.8734, |
| "mean_token_accuracy": 0.5720324814319611, |
| "num_tokens": 10378811.0, |
| "step": 195 |
| }, |
| { |
| "epoch": 2.484076433121019, |
| "grad_norm": 0.31449127197265625, |
| "learning_rate": 0.00014914038174232956, |
| "loss": 1.9198, |
| "mean_token_accuracy": 0.5604428052902222, |
| "num_tokens": 10430530.0, |
| "step": 196 |
| }, |
| { |
| "epoch": 2.4968152866242037, |
| "grad_norm": 0.31726551055908203, |
| "learning_rate": 0.0001486222945795494, |
| "loss": 1.7987, |
| "mean_token_accuracy": 0.5791361331939697, |
| "num_tokens": 10483299.0, |
| "step": 197 |
| }, |
| { |
| "epoch": 2.5095541401273884, |
| "grad_norm": 0.3228937089443207, |
| "learning_rate": 0.00014810249258083677, |
| "loss": 1.8528, |
| "mean_token_accuracy": 0.5770910084247589, |
| "num_tokens": 10537792.0, |
| "step": 198 |
| }, |
| { |
| "epoch": 2.522292993630573, |
| "grad_norm": 0.3331848978996277, |
| "learning_rate": 0.00014758099407883422, |
| "loss": 1.8389, |
| "mean_token_accuracy": 0.5750528275966644, |
| "num_tokens": 10592498.0, |
| "step": 199 |
| }, |
| { |
| "epoch": 2.535031847133758, |
| "grad_norm": 0.3170086741447449, |
| "learning_rate": 0.0001470578174660174, |
| "loss": 1.8815, |
| "mean_token_accuracy": 0.5696290135383606, |
| "num_tokens": 10647047.0, |
| "step": 200 |
| }, |
| { |
| "epoch": 2.5477707006369426, |
| "grad_norm": 0.35329344868659973, |
| "learning_rate": 0.00014653298119404645, |
| "loss": 1.9293, |
| "mean_token_accuracy": 0.5669050514698029, |
| "num_tokens": 10699223.0, |
| "step": 201 |
| }, |
| { |
| "epoch": 2.5605095541401273, |
| "grad_norm": 0.3157745599746704, |
| "learning_rate": 0.00014600650377311522, |
| "loss": 1.8966, |
| "mean_token_accuracy": 0.5621984302997589, |
| "num_tokens": 10753675.0, |
| "step": 202 |
| }, |
| { |
| "epoch": 2.573248407643312, |
| "grad_norm": 0.36428573727607727, |
| "learning_rate": 0.00014547840377129842, |
| "loss": 1.8287, |
| "mean_token_accuracy": 0.5743198990821838, |
| "num_tokens": 10806326.0, |
| "step": 203 |
| }, |
| { |
| "epoch": 2.5859872611464967, |
| "grad_norm": 0.33650118112564087, |
| "learning_rate": 0.0001449486998138968, |
| "loss": 1.8525, |
| "mean_token_accuracy": 0.575894296169281, |
| "num_tokens": 10858399.0, |
| "step": 204 |
| }, |
| { |
| "epoch": 2.5987261146496814, |
| "grad_norm": 0.3885926306247711, |
| "learning_rate": 0.00014441741058278024, |
| "loss": 1.9307, |
| "mean_token_accuracy": 0.5590022504329681, |
| "num_tokens": 10911133.0, |
| "step": 205 |
| }, |
| { |
| "epoch": 2.611464968152866, |
| "grad_norm": 0.3157569468021393, |
| "learning_rate": 0.0001438845548157288, |
| "loss": 1.8093, |
| "mean_token_accuracy": 0.580660492181778, |
| "num_tokens": 10966705.0, |
| "step": 206 |
| }, |
| { |
| "epoch": 2.624203821656051, |
| "grad_norm": 0.4603760838508606, |
| "learning_rate": 0.000143350151305772, |
| "loss": 1.9015, |
| "mean_token_accuracy": 0.5635307729244232, |
| "num_tokens": 11021934.0, |
| "step": 207 |
| }, |
| { |
| "epoch": 2.6369426751592355, |
| "grad_norm": 0.33797430992126465, |
| "learning_rate": 0.0001428142189005259, |
| "loss": 1.765, |
| "mean_token_accuracy": 0.5902499854564667, |
| "num_tokens": 11074478.0, |
| "step": 208 |
| }, |
| { |
| "epoch": 2.6496815286624202, |
| "grad_norm": 0.4025668799877167, |
| "learning_rate": 0.0001422767765015285, |
| "loss": 1.8225, |
| "mean_token_accuracy": 0.5761205554008484, |
| "num_tokens": 11127316.0, |
| "step": 209 |
| }, |
| { |
| "epoch": 2.662420382165605, |
| "grad_norm": 0.32198846340179443, |
| "learning_rate": 0.0001417378430635729, |
| "loss": 1.8854, |
| "mean_token_accuracy": 0.5675921738147736, |
| "num_tokens": 11181761.0, |
| "step": 210 |
| }, |
| { |
| "epoch": 2.6751592356687897, |
| "grad_norm": 0.3658575713634491, |
| "learning_rate": 0.00014119743759403907, |
| "loss": 1.8666, |
| "mean_token_accuracy": 0.5689597129821777, |
| "num_tokens": 11236998.0, |
| "step": 211 |
| }, |
| { |
| "epoch": 2.6878980891719744, |
| "grad_norm": 0.31915053725242615, |
| "learning_rate": 0.00014065557915222322, |
| "loss": 1.9386, |
| "mean_token_accuracy": 0.555518627166748, |
| "num_tokens": 11293038.0, |
| "step": 212 |
| }, |
| { |
| "epoch": 2.700636942675159, |
| "grad_norm": 0.3537184000015259, |
| "learning_rate": 0.00014011228684866582, |
| "loss": 1.9006, |
| "mean_token_accuracy": 0.5641106963157654, |
| "num_tokens": 11346609.0, |
| "step": 213 |
| }, |
| { |
| "epoch": 2.713375796178344, |
| "grad_norm": 0.32953932881355286, |
| "learning_rate": 0.00013956757984447745, |
| "loss": 1.8435, |
| "mean_token_accuracy": 0.5731501877307892, |
| "num_tokens": 11403344.0, |
| "step": 214 |
| }, |
| { |
| "epoch": 2.7261146496815285, |
| "grad_norm": 0.34561216831207275, |
| "learning_rate": 0.00013902147735066306, |
| "loss": 1.8715, |
| "mean_token_accuracy": 0.5735127329826355, |
| "num_tokens": 11453752.0, |
| "step": 215 |
| }, |
| { |
| "epoch": 2.738853503184713, |
| "grad_norm": 0.36158326268196106, |
| "learning_rate": 0.0001384739986274445, |
| "loss": 1.7981, |
| "mean_token_accuracy": 0.5859374105930328, |
| "num_tokens": 11506047.0, |
| "step": 216 |
| }, |
| { |
| "epoch": 2.7515923566878984, |
| "grad_norm": 0.32345420122146606, |
| "learning_rate": 0.00013792516298358114, |
| "loss": 1.9462, |
| "mean_token_accuracy": 0.5512464344501495, |
| "num_tokens": 11563918.0, |
| "step": 217 |
| }, |
| { |
| "epoch": 2.7643312101910826, |
| "grad_norm": 0.3586336076259613, |
| "learning_rate": 0.000137374989775689, |
| "loss": 1.8989, |
| "mean_token_accuracy": 0.5610895156860352, |
| "num_tokens": 11621441.0, |
| "step": 218 |
| }, |
| { |
| "epoch": 2.777070063694268, |
| "grad_norm": 0.3366152346134186, |
| "learning_rate": 0.00013682349840755785, |
| "loss": 1.8193, |
| "mean_token_accuracy": 0.578848123550415, |
| "num_tokens": 11673397.0, |
| "step": 219 |
| }, |
| { |
| "epoch": 2.789808917197452, |
| "grad_norm": 0.3884471654891968, |
| "learning_rate": 0.00013627070832946718, |
| "loss": 1.8242, |
| "mean_token_accuracy": 0.5773838758468628, |
| "num_tokens": 11721935.0, |
| "step": 220 |
| }, |
| { |
| "epoch": 2.802547770700637, |
| "grad_norm": 0.34199899435043335, |
| "learning_rate": 0.00013571663903749984, |
| "loss": 1.8577, |
| "mean_token_accuracy": 0.5714328587055206, |
| "num_tokens": 11773734.0, |
| "step": 221 |
| }, |
| { |
| "epoch": 2.8152866242038215, |
| "grad_norm": 0.33372578024864197, |
| "learning_rate": 0.00013516131007285483, |
| "loss": 1.9038, |
| "mean_token_accuracy": 0.5661661624908447, |
| "num_tokens": 11827411.0, |
| "step": 222 |
| }, |
| { |
| "epoch": 2.8280254777070066, |
| "grad_norm": 0.35299476981163025, |
| "learning_rate": 0.00013460474102115785, |
| "loss": 1.9305, |
| "mean_token_accuracy": 0.5539820492267609, |
| "num_tokens": 11885042.0, |
| "step": 223 |
| }, |
| { |
| "epoch": 2.840764331210191, |
| "grad_norm": 0.3262571394443512, |
| "learning_rate": 0.0001340469515117706, |
| "loss": 1.8395, |
| "mean_token_accuracy": 0.5769472420215607, |
| "num_tokens": 11937750.0, |
| "step": 224 |
| }, |
| { |
| "epoch": 2.853503184713376, |
| "grad_norm": 0.3454640805721283, |
| "learning_rate": 0.00013348796121709862, |
| "loss": 1.9303, |
| "mean_token_accuracy": 0.5540551543235779, |
| "num_tokens": 11994353.0, |
| "step": 225 |
| }, |
| { |
| "epoch": 2.8662420382165603, |
| "grad_norm": 0.3303540349006653, |
| "learning_rate": 0.00013292778985189724, |
| "loss": 1.8883, |
| "mean_token_accuracy": 0.5732137262821198, |
| "num_tokens": 12045209.0, |
| "step": 226 |
| }, |
| { |
| "epoch": 2.8789808917197455, |
| "grad_norm": 0.33723363280296326, |
| "learning_rate": 0.0001323664571725764, |
| "loss": 1.8401, |
| "mean_token_accuracy": 0.5693773925304413, |
| "num_tokens": 12100118.0, |
| "step": 227 |
| }, |
| { |
| "epoch": 2.8917197452229297, |
| "grad_norm": 0.3337755799293518, |
| "learning_rate": 0.00013180398297650393, |
| "loss": 1.8682, |
| "mean_token_accuracy": 0.5703003406524658, |
| "num_tokens": 12151199.0, |
| "step": 228 |
| }, |
| { |
| "epoch": 2.904458598726115, |
| "grad_norm": 0.3465191125869751, |
| "learning_rate": 0.00013124038710130722, |
| "loss": 1.9025, |
| "mean_token_accuracy": 0.5660633742809296, |
| "num_tokens": 12204560.0, |
| "step": 229 |
| }, |
| { |
| "epoch": 2.917197452229299, |
| "grad_norm": 0.3397550582885742, |
| "learning_rate": 0.00013067568942417356, |
| "loss": 1.8608, |
| "mean_token_accuracy": 0.577092707157135, |
| "num_tokens": 12254931.0, |
| "step": 230 |
| }, |
| { |
| "epoch": 2.9299363057324843, |
| "grad_norm": 0.3317429721355438, |
| "learning_rate": 0.00013010990986114926, |
| "loss": 1.8107, |
| "mean_token_accuracy": 0.583151251077652, |
| "num_tokens": 12306585.0, |
| "step": 231 |
| }, |
| { |
| "epoch": 2.9426751592356686, |
| "grad_norm": 0.33635950088500977, |
| "learning_rate": 0.00012954306836643703, |
| "loss": 1.8137, |
| "mean_token_accuracy": 0.5811544060707092, |
| "num_tokens": 12356388.0, |
| "step": 232 |
| }, |
| { |
| "epoch": 2.9554140127388537, |
| "grad_norm": 0.31903377175331116, |
| "learning_rate": 0.0001289751849316924, |
| "loss": 1.853, |
| "mean_token_accuracy": 0.5772639214992523, |
| "num_tokens": 12411393.0, |
| "step": 233 |
| }, |
| { |
| "epoch": 2.968152866242038, |
| "grad_norm": 0.3346429169178009, |
| "learning_rate": 0.0001284062795853185, |
| "loss": 1.8567, |
| "mean_token_accuracy": 0.5724359452724457, |
| "num_tokens": 12463451.0, |
| "step": 234 |
| }, |
| { |
| "epoch": 2.980891719745223, |
| "grad_norm": 0.31035116314888, |
| "learning_rate": 0.00012783637239175994, |
| "loss": 1.8257, |
| "mean_token_accuracy": 0.5784881711006165, |
| "num_tokens": 12516374.0, |
| "step": 235 |
| }, |
| { |
| "epoch": 2.9936305732484074, |
| "grad_norm": 0.3308963179588318, |
| "learning_rate": 0.00012726548345079475, |
| "loss": 1.8253, |
| "mean_token_accuracy": 0.5765515863895416, |
| "num_tokens": 12566904.0, |
| "step": 236 |
| }, |
| { |
| "epoch": 3.0, |
| "grad_norm": 0.3308963179588318, |
| "learning_rate": 0.00012669363289682584, |
| "loss": 1.7624, |
| "mean_token_accuracy": 0.5832459330558777, |
| "num_tokens": 12594595.0, |
| "step": 237 |
| }, |
| { |
| "epoch": 3.0127388535031847, |
| "grad_norm": 0.5709105730056763, |
| "learning_rate": 0.0001261208408981708, |
| "loss": 1.5348, |
| "mean_token_accuracy": 0.6312867105007172, |
| "num_tokens": 12645317.0, |
| "step": 238 |
| }, |
| { |
| "epoch": 3.0254777070063694, |
| "grad_norm": 0.37340834736824036, |
| "learning_rate": 0.00012554712765635057, |
| "loss": 1.5576, |
| "mean_token_accuracy": 0.6242968440055847, |
| "num_tokens": 12695870.0, |
| "step": 239 |
| }, |
| { |
| "epoch": 3.038216560509554, |
| "grad_norm": 0.42538464069366455, |
| "learning_rate": 0.0001249725134053769, |
| "loss": 1.6086, |
| "mean_token_accuracy": 0.6167311370372772, |
| "num_tokens": 12748747.0, |
| "step": 240 |
| }, |
| { |
| "epoch": 3.050955414012739, |
| "grad_norm": 0.6033649444580078, |
| "learning_rate": 0.00012439701841103888, |
| "loss": 1.5902, |
| "mean_token_accuracy": 0.6181419789791107, |
| "num_tokens": 12800818.0, |
| "step": 241 |
| }, |
| { |
| "epoch": 3.0636942675159236, |
| "grad_norm": 0.47527989745140076, |
| "learning_rate": 0.00012382066297018804, |
| "loss": 1.5442, |
| "mean_token_accuracy": 0.6306857764720917, |
| "num_tokens": 12852337.0, |
| "step": 242 |
| }, |
| { |
| "epoch": 3.0764331210191083, |
| "grad_norm": 0.45292210578918457, |
| "learning_rate": 0.0001232434674100226, |
| "loss": 1.5734, |
| "mean_token_accuracy": 0.6232933402061462, |
| "num_tokens": 12904277.0, |
| "step": 243 |
| }, |
| { |
| "epoch": 3.089171974522293, |
| "grad_norm": 0.4075813591480255, |
| "learning_rate": 0.00012266545208737054, |
| "loss": 1.6569, |
| "mean_token_accuracy": 0.6056897044181824, |
| "num_tokens": 12960388.0, |
| "step": 244 |
| }, |
| { |
| "epoch": 3.1019108280254777, |
| "grad_norm": 0.4078131914138794, |
| "learning_rate": 0.00012208663738797165, |
| "loss": 1.6845, |
| "mean_token_accuracy": 0.5976538956165314, |
| "num_tokens": 13017128.0, |
| "step": 245 |
| }, |
| { |
| "epoch": 3.1146496815286624, |
| "grad_norm": 0.4596061110496521, |
| "learning_rate": 0.00012150704372575854, |
| "loss": 1.6204, |
| "mean_token_accuracy": 0.6098415553569794, |
| "num_tokens": 13073046.0, |
| "step": 246 |
| }, |
| { |
| "epoch": 3.127388535031847, |
| "grad_norm": 0.4180206060409546, |
| "learning_rate": 0.00012092669154213665, |
| "loss": 1.5515, |
| "mean_token_accuracy": 0.625440239906311, |
| "num_tokens": 13127890.0, |
| "step": 247 |
| }, |
| { |
| "epoch": 3.140127388535032, |
| "grad_norm": 0.4547070562839508, |
| "learning_rate": 0.0001203456013052634, |
| "loss": 1.5243, |
| "mean_token_accuracy": 0.6310254037380219, |
| "num_tokens": 13176907.0, |
| "step": 248 |
| }, |
| { |
| "epoch": 3.1528662420382165, |
| "grad_norm": 0.44779738783836365, |
| "learning_rate": 0.00011976379350932618, |
| "loss": 1.6406, |
| "mean_token_accuracy": 0.61042121052742, |
| "num_tokens": 13231296.0, |
| "step": 249 |
| }, |
| { |
| "epoch": 3.1656050955414012, |
| "grad_norm": 0.4205434024333954, |
| "learning_rate": 0.00011918128867381965, |
| "loss": 1.601, |
| "mean_token_accuracy": 0.6144575476646423, |
| "num_tokens": 13286944.0, |
| "step": 250 |
| }, |
| { |
| "epoch": 3.178343949044586, |
| "grad_norm": 0.4262813925743103, |
| "learning_rate": 0.00011859810734282208, |
| "loss": 1.6048, |
| "mean_token_accuracy": 0.6148422658443451, |
| "num_tokens": 13339138.0, |
| "step": 251 |
| }, |
| { |
| "epoch": 3.1910828025477707, |
| "grad_norm": 0.403509259223938, |
| "learning_rate": 0.00011801427008427063, |
| "loss": 1.6419, |
| "mean_token_accuracy": 0.6066917181015015, |
| "num_tokens": 13393964.0, |
| "step": 252 |
| }, |
| { |
| "epoch": 3.2038216560509554, |
| "grad_norm": 0.42821204662323, |
| "learning_rate": 0.00011742979748923611, |
| "loss": 1.5761, |
| "mean_token_accuracy": 0.6225632727146149, |
| "num_tokens": 13444462.0, |
| "step": 253 |
| }, |
| { |
| "epoch": 3.21656050955414, |
| "grad_norm": 0.4207237958908081, |
| "learning_rate": 0.00011684471017119667, |
| "loss": 1.6251, |
| "mean_token_accuracy": 0.6090623736381531, |
| "num_tokens": 13497905.0, |
| "step": 254 |
| }, |
| { |
| "epoch": 3.229299363057325, |
| "grad_norm": 0.435561865568161, |
| "learning_rate": 0.00011625902876531082, |
| "loss": 1.5851, |
| "mean_token_accuracy": 0.6203322112560272, |
| "num_tokens": 13549797.0, |
| "step": 255 |
| }, |
| { |
| "epoch": 3.2420382165605095, |
| "grad_norm": 0.42979681491851807, |
| "learning_rate": 0.00011567277392768972, |
| "loss": 1.6543, |
| "mean_token_accuracy": 0.5996465981006622, |
| "num_tokens": 13607702.0, |
| "step": 256 |
| }, |
| { |
| "epoch": 3.254777070063694, |
| "grad_norm": 0.417309433221817, |
| "learning_rate": 0.00011508596633466852, |
| "loss": 1.631, |
| "mean_token_accuracy": 0.6050024628639221, |
| "num_tokens": 13663975.0, |
| "step": 257 |
| }, |
| { |
| "epoch": 3.267515923566879, |
| "grad_norm": 0.42910832166671753, |
| "learning_rate": 0.00011449862668207734, |
| "loss": 1.5504, |
| "mean_token_accuracy": 0.6264341771602631, |
| "num_tokens": 13715134.0, |
| "step": 258 |
| }, |
| { |
| "epoch": 3.2802547770700636, |
| "grad_norm": 0.4290030002593994, |
| "learning_rate": 0.00011391077568451116, |
| "loss": 1.6161, |
| "mean_token_accuracy": 0.6089867949485779, |
| "num_tokens": 13770372.0, |
| "step": 259 |
| }, |
| { |
| "epoch": 3.2929936305732483, |
| "grad_norm": 0.4092896282672882, |
| "learning_rate": 0.0001133224340745994, |
| "loss": 1.6254, |
| "mean_token_accuracy": 0.6103326678276062, |
| "num_tokens": 13824982.0, |
| "step": 260 |
| }, |
| { |
| "epoch": 3.305732484076433, |
| "grad_norm": 0.4829498529434204, |
| "learning_rate": 0.00011273362260227458, |
| "loss": 1.6772, |
| "mean_token_accuracy": 0.5996585786342621, |
| "num_tokens": 13878634.0, |
| "step": 261 |
| }, |
| { |
| "epoch": 3.3184713375796178, |
| "grad_norm": 0.42151686549186707, |
| "learning_rate": 0.00011214436203404062, |
| "loss": 1.6424, |
| "mean_token_accuracy": 0.6086190938949585, |
| "num_tokens": 13932699.0, |
| "step": 262 |
| }, |
| { |
| "epoch": 3.3312101910828025, |
| "grad_norm": 0.47397086024284363, |
| "learning_rate": 0.00011155467315224038, |
| "loss": 1.5956, |
| "mean_token_accuracy": 0.6170568764209747, |
| "num_tokens": 13987390.0, |
| "step": 263 |
| }, |
| { |
| "epoch": 3.343949044585987, |
| "grad_norm": 0.46223410964012146, |
| "learning_rate": 0.00011096457675432266, |
| "loss": 1.5429, |
| "mean_token_accuracy": 0.6272397041320801, |
| "num_tokens": 14042217.0, |
| "step": 264 |
| }, |
| { |
| "epoch": 3.356687898089172, |
| "grad_norm": 0.45418688654899597, |
| "learning_rate": 0.0001103740936521088, |
| "loss": 1.587, |
| "mean_token_accuracy": 0.6170405745506287, |
| "num_tokens": 14097146.0, |
| "step": 265 |
| }, |
| { |
| "epoch": 3.3694267515923566, |
| "grad_norm": 0.451417475938797, |
| "learning_rate": 0.00010978324467105858, |
| "loss": 1.5889, |
| "mean_token_accuracy": 0.6181528270244598, |
| "num_tokens": 14150140.0, |
| "step": 266 |
| }, |
| { |
| "epoch": 3.3821656050955413, |
| "grad_norm": 0.4451967477798462, |
| "learning_rate": 0.00010919205064953582, |
| "loss": 1.6392, |
| "mean_token_accuracy": 0.6059041917324066, |
| "num_tokens": 14203411.0, |
| "step": 267 |
| }, |
| { |
| "epoch": 3.394904458598726, |
| "grad_norm": 0.45706379413604736, |
| "learning_rate": 0.00010860053243807338, |
| "loss": 1.5662, |
| "mean_token_accuracy": 0.6224644184112549, |
| "num_tokens": 14255594.0, |
| "step": 268 |
| }, |
| { |
| "epoch": 3.4076433121019107, |
| "grad_norm": 0.4251766502857208, |
| "learning_rate": 0.00010800871089863785, |
| "loss": 1.6594, |
| "mean_token_accuracy": 0.6004246771335602, |
| "num_tokens": 14309453.0, |
| "step": 269 |
| }, |
| { |
| "epoch": 3.4203821656050954, |
| "grad_norm": 0.43268513679504395, |
| "learning_rate": 0.00010741660690389365, |
| "loss": 1.6486, |
| "mean_token_accuracy": 0.60761758685112, |
| "num_tokens": 14362531.0, |
| "step": 270 |
| }, |
| { |
| "epoch": 3.43312101910828, |
| "grad_norm": 0.4630923271179199, |
| "learning_rate": 0.0001068242413364671, |
| "loss": 1.6296, |
| "mean_token_accuracy": 0.6059266030788422, |
| "num_tokens": 14416899.0, |
| "step": 271 |
| }, |
| { |
| "epoch": 3.445859872611465, |
| "grad_norm": 0.44578132033348083, |
| "learning_rate": 0.00010623163508820977, |
| "loss": 1.5702, |
| "mean_token_accuracy": 0.6231890618801117, |
| "num_tokens": 14467276.0, |
| "step": 272 |
| }, |
| { |
| "epoch": 3.4585987261146496, |
| "grad_norm": 0.4357207119464874, |
| "learning_rate": 0.00010563880905946159, |
| "loss": 1.6422, |
| "mean_token_accuracy": 0.6079367101192474, |
| "num_tokens": 14520632.0, |
| "step": 273 |
| }, |
| { |
| "epoch": 3.4713375796178343, |
| "grad_norm": 0.45229652523994446, |
| "learning_rate": 0.00010504578415831395, |
| "loss": 1.5766, |
| "mean_token_accuracy": 0.6189067661762238, |
| "num_tokens": 14573666.0, |
| "step": 274 |
| }, |
| { |
| "epoch": 3.484076433121019, |
| "grad_norm": 0.4296993017196655, |
| "learning_rate": 0.00010445258129987206, |
| "loss": 1.6185, |
| "mean_token_accuracy": 0.6093391180038452, |
| "num_tokens": 14628510.0, |
| "step": 275 |
| }, |
| { |
| "epoch": 3.4968152866242037, |
| "grad_norm": 0.4645271897315979, |
| "learning_rate": 0.00010385922140551752, |
| "loss": 1.6316, |
| "mean_token_accuracy": 0.6081016957759857, |
| "num_tokens": 14680839.0, |
| "step": 276 |
| }, |
| { |
| "epoch": 3.5095541401273884, |
| "grad_norm": 0.4231947660446167, |
| "learning_rate": 0.00010326572540217028, |
| "loss": 1.5685, |
| "mean_token_accuracy": 0.6181470155715942, |
| "num_tokens": 14734284.0, |
| "step": 277 |
| }, |
| { |
| "epoch": 3.522292993630573, |
| "grad_norm": 0.45970481634140015, |
| "learning_rate": 0.00010267211422155072, |
| "loss": 1.689, |
| "mean_token_accuracy": 0.5970478057861328, |
| "num_tokens": 14789749.0, |
| "step": 278 |
| }, |
| { |
| "epoch": 3.535031847133758, |
| "grad_norm": 0.45939549803733826, |
| "learning_rate": 0.00010207840879944123, |
| "loss": 1.657, |
| "mean_token_accuracy": 0.6039794981479645, |
| "num_tokens": 14844791.0, |
| "step": 279 |
| }, |
| { |
| "epoch": 3.5477707006369426, |
| "grad_norm": 0.4448122978210449, |
| "learning_rate": 0.0001014846300749481, |
| "loss": 1.5795, |
| "mean_token_accuracy": 0.6173191368579865, |
| "num_tokens": 14899936.0, |
| "step": 280 |
| }, |
| { |
| "epoch": 3.5605095541401273, |
| "grad_norm": 0.45363184809684753, |
| "learning_rate": 0.00010089079898976284, |
| "loss": 1.6463, |
| "mean_token_accuracy": 0.606724739074707, |
| "num_tokens": 14951801.0, |
| "step": 281 |
| }, |
| { |
| "epoch": 3.573248407643312, |
| "grad_norm": 0.4669179916381836, |
| "learning_rate": 0.00010029693648742355, |
| "loss": 1.5501, |
| "mean_token_accuracy": 0.6252025663852692, |
| "num_tokens": 15003466.0, |
| "step": 282 |
| }, |
| { |
| "epoch": 3.5859872611464967, |
| "grad_norm": 0.4588845372200012, |
| "learning_rate": 9.970306351257647e-05, |
| "loss": 1.5634, |
| "mean_token_accuracy": 0.6214375197887421, |
| "num_tokens": 15053985.0, |
| "step": 283 |
| }, |
| { |
| "epoch": 3.5987261146496814, |
| "grad_norm": 0.4477427303791046, |
| "learning_rate": 9.910920101023717e-05, |
| "loss": 1.5378, |
| "mean_token_accuracy": 0.6221558153629303, |
| "num_tokens": 15106417.0, |
| "step": 284 |
| }, |
| { |
| "epoch": 3.611464968152866, |
| "grad_norm": 0.46768298745155334, |
| "learning_rate": 9.851536992505188e-05, |
| "loss": 1.6178, |
| "mean_token_accuracy": 0.6068744659423828, |
| "num_tokens": 15160298.0, |
| "step": 285 |
| }, |
| { |
| "epoch": 3.624203821656051, |
| "grad_norm": 0.4312836825847626, |
| "learning_rate": 9.79215912005588e-05, |
| "loss": 1.6021, |
| "mean_token_accuracy": 0.6140561103820801, |
| "num_tokens": 15212466.0, |
| "step": 286 |
| }, |
| { |
| "epoch": 3.6369426751592355, |
| "grad_norm": 0.44851383566856384, |
| "learning_rate": 9.732788577844934e-05, |
| "loss": 1.6538, |
| "mean_token_accuracy": 0.6001670658588409, |
| "num_tokens": 15265693.0, |
| "step": 287 |
| }, |
| { |
| "epoch": 3.6496815286624202, |
| "grad_norm": 0.4596638083457947, |
| "learning_rate": 9.673427459782974e-05, |
| "loss": 1.599, |
| "mean_token_accuracy": 0.6147986352443695, |
| "num_tokens": 15319305.0, |
| "step": 288 |
| }, |
| { |
| "epoch": 3.662420382165605, |
| "grad_norm": 0.4196668565273285, |
| "learning_rate": 9.61407785944825e-05, |
| "loss": 1.612, |
| "mean_token_accuracy": 0.6101915836334229, |
| "num_tokens": 15373229.0, |
| "step": 289 |
| }, |
| { |
| "epoch": 3.6751592356687897, |
| "grad_norm": 0.4389522075653076, |
| "learning_rate": 9.554741870012797e-05, |
| "loss": 1.6116, |
| "mean_token_accuracy": 0.6180192828178406, |
| "num_tokens": 15424052.0, |
| "step": 290 |
| }, |
| { |
| "epoch": 3.6878980891719744, |
| "grad_norm": 0.4534909129142761, |
| "learning_rate": 9.495421584168609e-05, |
| "loss": 1.5581, |
| "mean_token_accuracy": 0.6236461997032166, |
| "num_tokens": 15477522.0, |
| "step": 291 |
| }, |
| { |
| "epoch": 3.700636942675159, |
| "grad_norm": 0.4369897246360779, |
| "learning_rate": 9.436119094053846e-05, |
| "loss": 1.5265, |
| "mean_token_accuracy": 0.6339597702026367, |
| "num_tokens": 15526462.0, |
| "step": 292 |
| }, |
| { |
| "epoch": 3.713375796178344, |
| "grad_norm": 0.437324196100235, |
| "learning_rate": 9.376836491179028e-05, |
| "loss": 1.6315, |
| "mean_token_accuracy": 0.612496554851532, |
| "num_tokens": 15580253.0, |
| "step": 293 |
| }, |
| { |
| "epoch": 3.7261146496815285, |
| "grad_norm": 0.4279663562774658, |
| "learning_rate": 9.317575866353292e-05, |
| "loss": 1.6586, |
| "mean_token_accuracy": 0.602456271648407, |
| "num_tokens": 15634968.0, |
| "step": 294 |
| }, |
| { |
| "epoch": 3.738853503184713, |
| "grad_norm": 0.44840502738952637, |
| "learning_rate": 9.258339309610637e-05, |
| "loss": 1.5754, |
| "mean_token_accuracy": 0.621392697095871, |
| "num_tokens": 15685372.0, |
| "step": 295 |
| }, |
| { |
| "epoch": 3.7515923566878984, |
| "grad_norm": 0.43560630083084106, |
| "learning_rate": 9.199128910136219e-05, |
| "loss": 1.6192, |
| "mean_token_accuracy": 0.6109454035758972, |
| "num_tokens": 15740582.0, |
| "step": 296 |
| }, |
| { |
| "epoch": 3.7643312101910826, |
| "grad_norm": 0.43762698769569397, |
| "learning_rate": 9.139946756192663e-05, |
| "loss": 1.6574, |
| "mean_token_accuracy": 0.6039230525493622, |
| "num_tokens": 15795625.0, |
| "step": 297 |
| }, |
| { |
| "epoch": 3.777070063694268, |
| "grad_norm": 0.4506418704986572, |
| "learning_rate": 9.080794935046421e-05, |
| "loss": 1.7151, |
| "mean_token_accuracy": 0.5921238660812378, |
| "num_tokens": 15851160.0, |
| "step": 298 |
| }, |
| { |
| "epoch": 3.789808917197452, |
| "grad_norm": 0.4315105974674225, |
| "learning_rate": 9.021675532894145e-05, |
| "loss": 1.6071, |
| "mean_token_accuracy": 0.6140862107276917, |
| "num_tokens": 15905320.0, |
| "step": 299 |
| }, |
| { |
| "epoch": 3.802547770700637, |
| "grad_norm": 0.42772069573402405, |
| "learning_rate": 8.962590634789123e-05, |
| "loss": 1.5918, |
| "mean_token_accuracy": 0.6131418347358704, |
| "num_tokens": 15958430.0, |
| "step": 300 |
| }, |
| { |
| "epoch": 3.8152866242038215, |
| "grad_norm": 0.4342682957649231, |
| "learning_rate": 8.903542324567736e-05, |
| "loss": 1.6069, |
| "mean_token_accuracy": 0.612420380115509, |
| "num_tokens": 16011686.0, |
| "step": 301 |
| }, |
| { |
| "epoch": 3.8280254777070066, |
| "grad_norm": 0.4235387146472931, |
| "learning_rate": 8.844532684775963e-05, |
| "loss": 1.5833, |
| "mean_token_accuracy": 0.6175683438777924, |
| "num_tokens": 16065791.0, |
| "step": 302 |
| }, |
| { |
| "epoch": 3.840764331210191, |
| "grad_norm": 0.4537542462348938, |
| "learning_rate": 8.785563796595938e-05, |
| "loss": 1.5187, |
| "mean_token_accuracy": 0.6387709379196167, |
| "num_tokens": 16118281.0, |
| "step": 303 |
| }, |
| { |
| "epoch": 3.853503184713376, |
| "grad_norm": 0.4140053391456604, |
| "learning_rate": 8.726637739772542e-05, |
| "loss": 1.5997, |
| "mean_token_accuracy": 0.6152973771095276, |
| "num_tokens": 16171205.0, |
| "step": 304 |
| }, |
| { |
| "epoch": 3.8662420382165603, |
| "grad_norm": 0.43215644359588623, |
| "learning_rate": 8.667756592540064e-05, |
| "loss": 1.5819, |
| "mean_token_accuracy": 0.6192367970943451, |
| "num_tokens": 16226137.0, |
| "step": 305 |
| }, |
| { |
| "epoch": 3.8789808917197455, |
| "grad_norm": 0.43919017910957336, |
| "learning_rate": 8.608922431548887e-05, |
| "loss": 1.6109, |
| "mean_token_accuracy": 0.6121656596660614, |
| "num_tokens": 16280969.0, |
| "step": 306 |
| }, |
| { |
| "epoch": 3.8917197452229297, |
| "grad_norm": 0.46311888098716736, |
| "learning_rate": 8.55013733179227e-05, |
| "loss": 1.6064, |
| "mean_token_accuracy": 0.6149270236492157, |
| "num_tokens": 16333220.0, |
| "step": 307 |
| }, |
| { |
| "epoch": 3.904458598726115, |
| "grad_norm": 0.43454501032829285, |
| "learning_rate": 8.49140336653315e-05, |
| "loss": 1.5255, |
| "mean_token_accuracy": 0.6324739158153534, |
| "num_tokens": 16387242.0, |
| "step": 308 |
| }, |
| { |
| "epoch": 3.917197452229299, |
| "grad_norm": 0.42468395829200745, |
| "learning_rate": 8.43272260723103e-05, |
| "loss": 1.6324, |
| "mean_token_accuracy": 0.6103453934192657, |
| "num_tokens": 16440644.0, |
| "step": 309 |
| }, |
| { |
| "epoch": 3.9299363057324843, |
| "grad_norm": 0.42441028356552124, |
| "learning_rate": 8.374097123468918e-05, |
| "loss": 1.7077, |
| "mean_token_accuracy": 0.5908953249454498, |
| "num_tokens": 16497832.0, |
| "step": 310 |
| }, |
| { |
| "epoch": 3.9426751592356686, |
| "grad_norm": 0.4248032867908478, |
| "learning_rate": 8.315528982880337e-05, |
| "loss": 1.5252, |
| "mean_token_accuracy": 0.630544900894165, |
| "num_tokens": 16550056.0, |
| "step": 311 |
| }, |
| { |
| "epoch": 3.9554140127388537, |
| "grad_norm": 0.4091551601886749, |
| "learning_rate": 8.257020251076393e-05, |
| "loss": 1.7251, |
| "mean_token_accuracy": 0.5953080356121063, |
| "num_tokens": 16604770.0, |
| "step": 312 |
| }, |
| { |
| "epoch": 3.968152866242038, |
| "grad_norm": 0.4335462152957916, |
| "learning_rate": 8.198572991572939e-05, |
| "loss": 1.5564, |
| "mean_token_accuracy": 0.6247545778751373, |
| "num_tokens": 16656307.0, |
| "step": 313 |
| }, |
| { |
| "epoch": 3.980891719745223, |
| "grad_norm": 0.4381133019924164, |
| "learning_rate": 8.140189265717794e-05, |
| "loss": 1.697, |
| "mean_token_accuracy": 0.5903680324554443, |
| "num_tokens": 16712946.0, |
| "step": 314 |
| }, |
| { |
| "epoch": 3.9936305732484074, |
| "grad_norm": 0.4349663257598877, |
| "learning_rate": 8.081871132618036e-05, |
| "loss": 1.5864, |
| "mean_token_accuracy": 0.6181161403656006, |
| "num_tokens": 16766918.0, |
| "step": 315 |
| }, |
| { |
| "epoch": 4.0, |
| "grad_norm": 0.710847795009613, |
| "learning_rate": 8.023620649067384e-05, |
| "loss": 1.3252, |
| "mean_token_accuracy": 0.673402726650238, |
| "num_tokens": 16791742.0, |
| "step": 316 |
| }, |
| { |
| "epoch": 4.012738853503185, |
| "grad_norm": 0.5439519882202148, |
| "learning_rate": 7.965439869473664e-05, |
| "loss": 1.3862, |
| "mean_token_accuracy": 0.6603533327579498, |
| "num_tokens": 16845599.0, |
| "step": 317 |
| }, |
| { |
| "epoch": 4.025477707006369, |
| "grad_norm": 0.5056113004684448, |
| "learning_rate": 7.907330845786337e-05, |
| "loss": 1.3117, |
| "mean_token_accuracy": 0.6728927791118622, |
| "num_tokens": 16903029.0, |
| "step": 318 |
| }, |
| { |
| "epoch": 4.038216560509555, |
| "grad_norm": 0.6413962841033936, |
| "learning_rate": 7.849295627424148e-05, |
| "loss": 1.2577, |
| "mean_token_accuracy": 0.6805729269981384, |
| "num_tokens": 16956656.0, |
| "step": 319 |
| }, |
| { |
| "epoch": 4.050955414012739, |
| "grad_norm": 0.899278461933136, |
| "learning_rate": 7.791336261202835e-05, |
| "loss": 1.4156, |
| "mean_token_accuracy": 0.6467656791210175, |
| "num_tokens": 17014671.0, |
| "step": 320 |
| }, |
| { |
| "epoch": 4.063694267515924, |
| "grad_norm": 0.6237316727638245, |
| "learning_rate": 7.733454791262947e-05, |
| "loss": 1.3492, |
| "mean_token_accuracy": 0.6739301681518555, |
| "num_tokens": 17067978.0, |
| "step": 321 |
| }, |
| { |
| "epoch": 4.076433121019108, |
| "grad_norm": 0.5638516545295715, |
| "learning_rate": 7.67565325899774e-05, |
| "loss": 1.3656, |
| "mean_token_accuracy": 0.6638805568218231, |
| "num_tokens": 17121757.0, |
| "step": 322 |
| }, |
| { |
| "epoch": 4.089171974522293, |
| "grad_norm": 0.5784188508987427, |
| "learning_rate": 7.617933702981198e-05, |
| "loss": 1.3717, |
| "mean_token_accuracy": 0.6573343873023987, |
| "num_tokens": 17173561.0, |
| "step": 323 |
| }, |
| { |
| "epoch": 4.101910828025478, |
| "grad_norm": 0.5291357040405273, |
| "learning_rate": 7.560298158896114e-05, |
| "loss": 1.3286, |
| "mean_token_accuracy": 0.6641911864280701, |
| "num_tokens": 17227738.0, |
| "step": 324 |
| }, |
| { |
| "epoch": 4.114649681528663, |
| "grad_norm": 0.5891243815422058, |
| "learning_rate": 7.502748659462311e-05, |
| "loss": 1.3093, |
| "mean_token_accuracy": 0.6751121878623962, |
| "num_tokens": 17277389.0, |
| "step": 325 |
| }, |
| { |
| "epoch": 4.127388535031847, |
| "grad_norm": 0.6397759914398193, |
| "learning_rate": 7.445287234364946e-05, |
| "loss": 1.355, |
| "mean_token_accuracy": 0.6581599414348602, |
| "num_tokens": 17333692.0, |
| "step": 326 |
| }, |
| { |
| "epoch": 4.140127388535032, |
| "grad_norm": 0.6335495710372925, |
| "learning_rate": 7.38791591018292e-05, |
| "loss": 1.2835, |
| "mean_token_accuracy": 0.6767120361328125, |
| "num_tokens": 17385957.0, |
| "step": 327 |
| }, |
| { |
| "epoch": 4.1528662420382165, |
| "grad_norm": 0.5888403654098511, |
| "learning_rate": 7.330636710317417e-05, |
| "loss": 1.3085, |
| "mean_token_accuracy": 0.6664162874221802, |
| "num_tokens": 17444104.0, |
| "step": 328 |
| }, |
| { |
| "epoch": 4.165605095541402, |
| "grad_norm": 0.5644891858100891, |
| "learning_rate": 7.273451654920532e-05, |
| "loss": 1.3947, |
| "mean_token_accuracy": 0.650380402803421, |
| "num_tokens": 17502810.0, |
| "step": 329 |
| }, |
| { |
| "epoch": 4.178343949044586, |
| "grad_norm": 0.5841726064682007, |
| "learning_rate": 7.21636276082401e-05, |
| "loss": 1.2907, |
| "mean_token_accuracy": 0.6746163070201874, |
| "num_tokens": 17555488.0, |
| "step": 330 |
| }, |
| { |
| "epoch": 4.191082802547771, |
| "grad_norm": 0.5533628463745117, |
| "learning_rate": 7.15937204146815e-05, |
| "loss": 1.3046, |
| "mean_token_accuracy": 0.6744789183139801, |
| "num_tokens": 17610233.0, |
| "step": 331 |
| }, |
| { |
| "epoch": 4.203821656050955, |
| "grad_norm": 0.5649828910827637, |
| "learning_rate": 7.102481506830764e-05, |
| "loss": 1.228, |
| "mean_token_accuracy": 0.693218320608139, |
| "num_tokens": 17662910.0, |
| "step": 332 |
| }, |
| { |
| "epoch": 4.2165605095541405, |
| "grad_norm": 0.5603880882263184, |
| "learning_rate": 7.0456931633563e-05, |
| "loss": 1.2269, |
| "mean_token_accuracy": 0.6878877878189087, |
| "num_tokens": 17715135.0, |
| "step": 333 |
| }, |
| { |
| "epoch": 4.229299363057325, |
| "grad_norm": 0.5503774881362915, |
| "learning_rate": 6.989009013885077e-05, |
| "loss": 1.2708, |
| "mean_token_accuracy": 0.6807169020175934, |
| "num_tokens": 17767413.0, |
| "step": 334 |
| }, |
| { |
| "epoch": 4.24203821656051, |
| "grad_norm": 0.5674378275871277, |
| "learning_rate": 6.932431057582647e-05, |
| "loss": 1.3011, |
| "mean_token_accuracy": 0.6756401658058167, |
| "num_tokens": 17822708.0, |
| "step": 335 |
| }, |
| { |
| "epoch": 4.254777070063694, |
| "grad_norm": 0.5780754685401917, |
| "learning_rate": 6.875961289869283e-05, |
| "loss": 1.3628, |
| "mean_token_accuracy": 0.656164288520813, |
| "num_tokens": 17874618.0, |
| "step": 336 |
| }, |
| { |
| "epoch": 4.267515923566879, |
| "grad_norm": 0.5727635025978088, |
| "learning_rate": 6.819601702349609e-05, |
| "loss": 1.2003, |
| "mean_token_accuracy": 0.6980417370796204, |
| "num_tokens": 17928242.0, |
| "step": 337 |
| }, |
| { |
| "epoch": 4.280254777070064, |
| "grad_norm": 0.5978534817695618, |
| "learning_rate": 6.763354282742363e-05, |
| "loss": 1.3634, |
| "mean_token_accuracy": 0.6629419326782227, |
| "num_tokens": 17983335.0, |
| "step": 338 |
| }, |
| { |
| "epoch": 4.292993630573249, |
| "grad_norm": 0.5879784822463989, |
| "learning_rate": 6.707221014810279e-05, |
| "loss": 1.3021, |
| "mean_token_accuracy": 0.6740579605102539, |
| "num_tokens": 18035861.0, |
| "step": 339 |
| }, |
| { |
| "epoch": 4.305732484076433, |
| "grad_norm": 0.5777925848960876, |
| "learning_rate": 6.651203878290139e-05, |
| "loss": 1.4033, |
| "mean_token_accuracy": 0.6527241766452789, |
| "num_tokens": 18089211.0, |
| "step": 340 |
| }, |
| { |
| "epoch": 4.318471337579618, |
| "grad_norm": 0.5422646403312683, |
| "learning_rate": 6.59530484882294e-05, |
| "loss": 1.3524, |
| "mean_token_accuracy": 0.662738710641861, |
| "num_tokens": 18145588.0, |
| "step": 341 |
| }, |
| { |
| "epoch": 4.3312101910828025, |
| "grad_norm": 0.5661242008209229, |
| "learning_rate": 6.539525897884219e-05, |
| "loss": 1.2663, |
| "mean_token_accuracy": 0.6824060380458832, |
| "num_tokens": 18195902.0, |
| "step": 342 |
| }, |
| { |
| "epoch": 4.343949044585988, |
| "grad_norm": 0.5987046957015991, |
| "learning_rate": 6.48386899271452e-05, |
| "loss": 1.3167, |
| "mean_token_accuracy": 0.6675301194190979, |
| "num_tokens": 18246257.0, |
| "step": 343 |
| }, |
| { |
| "epoch": 4.356687898089172, |
| "grad_norm": 0.5884360074996948, |
| "learning_rate": 6.428336096250019e-05, |
| "loss": 1.2387, |
| "mean_token_accuracy": 0.6884565055370331, |
| "num_tokens": 18295900.0, |
| "step": 344 |
| }, |
| { |
| "epoch": 4.369426751592357, |
| "grad_norm": 0.5758609771728516, |
| "learning_rate": 6.372929167053286e-05, |
| "loss": 1.3223, |
| "mean_token_accuracy": 0.6655027866363525, |
| "num_tokens": 18350010.0, |
| "step": 345 |
| }, |
| { |
| "epoch": 4.382165605095541, |
| "grad_norm": 0.5874727368354797, |
| "learning_rate": 6.317650159244212e-05, |
| "loss": 1.3319, |
| "mean_token_accuracy": 0.6696738302707672, |
| "num_tokens": 18402566.0, |
| "step": 346 |
| }, |
| { |
| "epoch": 4.3949044585987265, |
| "grad_norm": 0.6059537529945374, |
| "learning_rate": 6.2625010224311e-05, |
| "loss": 1.2889, |
| "mean_token_accuracy": 0.6799558997154236, |
| "num_tokens": 18454978.0, |
| "step": 347 |
| }, |
| { |
| "epoch": 4.407643312101911, |
| "grad_norm": 0.586950957775116, |
| "learning_rate": 6.207483701641888e-05, |
| "loss": 1.309, |
| "mean_token_accuracy": 0.673223465681076, |
| "num_tokens": 18506541.0, |
| "step": 348 |
| }, |
| { |
| "epoch": 4.420382165605096, |
| "grad_norm": 0.5819146037101746, |
| "learning_rate": 6.15260013725555e-05, |
| "loss": 1.3644, |
| "mean_token_accuracy": 0.6632392704486847, |
| "num_tokens": 18557931.0, |
| "step": 349 |
| }, |
| { |
| "epoch": 4.43312101910828, |
| "grad_norm": 0.5691138505935669, |
| "learning_rate": 6.097852264933697e-05, |
| "loss": 1.386, |
| "mean_token_accuracy": 0.6523266136646271, |
| "num_tokens": 18613153.0, |
| "step": 350 |
| }, |
| { |
| "epoch": 4.445859872611465, |
| "grad_norm": 0.5579886436462402, |
| "learning_rate": 6.043242015552258e-05, |
| "loss": 1.3543, |
| "mean_token_accuracy": 0.660747766494751, |
| "num_tokens": 18666337.0, |
| "step": 351 |
| }, |
| { |
| "epoch": 4.45859872611465, |
| "grad_norm": 0.5413755178451538, |
| "learning_rate": 5.988771315133418e-05, |
| "loss": 1.4394, |
| "mean_token_accuracy": 0.64309361577034, |
| "num_tokens": 18722640.0, |
| "step": 352 |
| }, |
| { |
| "epoch": 4.471337579617835, |
| "grad_norm": 0.5620366930961609, |
| "learning_rate": 5.934442084777676e-05, |
| "loss": 1.3786, |
| "mean_token_accuracy": 0.6538053452968597, |
| "num_tokens": 18778298.0, |
| "step": 353 |
| }, |
| { |
| "epoch": 4.484076433121019, |
| "grad_norm": 0.5585454106330872, |
| "learning_rate": 5.880256240596096e-05, |
| "loss": 1.2928, |
| "mean_token_accuracy": 0.6763462126255035, |
| "num_tokens": 18831628.0, |
| "step": 354 |
| }, |
| { |
| "epoch": 4.496815286624204, |
| "grad_norm": 0.5773540139198303, |
| "learning_rate": 5.8262156936427096e-05, |
| "loss": 1.3325, |
| "mean_token_accuracy": 0.6678478717803955, |
| "num_tokens": 18883919.0, |
| "step": 355 |
| }, |
| { |
| "epoch": 4.509554140127388, |
| "grad_norm": 0.5874897837638855, |
| "learning_rate": 5.772322349847154e-05, |
| "loss": 1.3506, |
| "mean_token_accuracy": 0.6611494421958923, |
| "num_tokens": 18940158.0, |
| "step": 356 |
| }, |
| { |
| "epoch": 4.522292993630574, |
| "grad_norm": 0.5982579588890076, |
| "learning_rate": 5.71857810994741e-05, |
| "loss": 1.2726, |
| "mean_token_accuracy": 0.6766319572925568, |
| "num_tokens": 18990223.0, |
| "step": 357 |
| }, |
| { |
| "epoch": 4.535031847133758, |
| "grad_norm": 0.5581091046333313, |
| "learning_rate": 5.6649848694228026e-05, |
| "loss": 1.3535, |
| "mean_token_accuracy": 0.6625830829143524, |
| "num_tokens": 19045126.0, |
| "step": 358 |
| }, |
| { |
| "epoch": 4.547770700636943, |
| "grad_norm": 0.5802775025367737, |
| "learning_rate": 5.611544518427121e-05, |
| "loss": 1.2707, |
| "mean_token_accuracy": 0.6781118214130402, |
| "num_tokens": 19094650.0, |
| "step": 359 |
| }, |
| { |
| "epoch": 4.560509554140127, |
| "grad_norm": 0.5925814509391785, |
| "learning_rate": 5.558258941721982e-05, |
| "loss": 1.3001, |
| "mean_token_accuracy": 0.6749387383460999, |
| "num_tokens": 19146493.0, |
| "step": 360 |
| }, |
| { |
| "epoch": 4.573248407643312, |
| "grad_norm": 0.5560547709465027, |
| "learning_rate": 5.5051300186103214e-05, |
| "loss": 1.3444, |
| "mean_token_accuracy": 0.6658226251602173, |
| "num_tokens": 19200056.0, |
| "step": 361 |
| }, |
| { |
| "epoch": 4.585987261146497, |
| "grad_norm": 0.5550312995910645, |
| "learning_rate": 5.452159622870158e-05, |
| "loss": 1.2867, |
| "mean_token_accuracy": 0.6791023910045624, |
| "num_tokens": 19254330.0, |
| "step": 362 |
| }, |
| { |
| "epoch": 4.598726114649682, |
| "grad_norm": 0.5698755383491516, |
| "learning_rate": 5.399349622688479e-05, |
| "loss": 1.3115, |
| "mean_token_accuracy": 0.6727179288864136, |
| "num_tokens": 19308203.0, |
| "step": 363 |
| }, |
| { |
| "epoch": 4.611464968152866, |
| "grad_norm": 0.5808539986610413, |
| "learning_rate": 5.346701880595354e-05, |
| "loss": 1.25, |
| "mean_token_accuracy": 0.6817833781242371, |
| "num_tokens": 19360505.0, |
| "step": 364 |
| }, |
| { |
| "epoch": 4.624203821656051, |
| "grad_norm": 0.5801878571510315, |
| "learning_rate": 5.29421825339826e-05, |
| "loss": 1.3489, |
| "mean_token_accuracy": 0.6604253947734833, |
| "num_tokens": 19415107.0, |
| "step": 365 |
| }, |
| { |
| "epoch": 4.6369426751592355, |
| "grad_norm": 0.562362551689148, |
| "learning_rate": 5.24190059211658e-05, |
| "loss": 1.2972, |
| "mean_token_accuracy": 0.6697467267513275, |
| "num_tokens": 19471390.0, |
| "step": 366 |
| }, |
| { |
| "epoch": 4.649681528662421, |
| "grad_norm": 0.5844375491142273, |
| "learning_rate": 5.189750741916326e-05, |
| "loss": 1.2506, |
| "mean_token_accuracy": 0.6850372850894928, |
| "num_tokens": 19524341.0, |
| "step": 367 |
| }, |
| { |
| "epoch": 4.662420382165605, |
| "grad_norm": 0.583635151386261, |
| "learning_rate": 5.137770542045063e-05, |
| "loss": 1.3336, |
| "mean_token_accuracy": 0.6662910580635071, |
| "num_tokens": 19579112.0, |
| "step": 368 |
| }, |
| { |
| "epoch": 4.67515923566879, |
| "grad_norm": 0.5848417282104492, |
| "learning_rate": 5.085961825767049e-05, |
| "loss": 1.3237, |
| "mean_token_accuracy": 0.6704005897045135, |
| "num_tokens": 19629515.0, |
| "step": 369 |
| }, |
| { |
| "epoch": 4.687898089171974, |
| "grad_norm": 0.5747386813163757, |
| "learning_rate": 5.0343264202985575e-05, |
| "loss": 1.3051, |
| "mean_token_accuracy": 0.67464280128479, |
| "num_tokens": 19683814.0, |
| "step": 370 |
| }, |
| { |
| "epoch": 4.7006369426751595, |
| "grad_norm": 0.5863603949546814, |
| "learning_rate": 4.9828661467434644e-05, |
| "loss": 1.3308, |
| "mean_token_accuracy": 0.666056215763092, |
| "num_tokens": 19737421.0, |
| "step": 371 |
| }, |
| { |
| "epoch": 4.713375796178344, |
| "grad_norm": 0.5642786026000977, |
| "learning_rate": 4.93158282002899e-05, |
| "loss": 1.3423, |
| "mean_token_accuracy": 0.6685330271720886, |
| "num_tokens": 19789487.0, |
| "step": 372 |
| }, |
| { |
| "epoch": 4.726114649681529, |
| "grad_norm": 0.5639926195144653, |
| "learning_rate": 4.8804782488417054e-05, |
| "loss": 1.3475, |
| "mean_token_accuracy": 0.66647008061409, |
| "num_tokens": 19845546.0, |
| "step": 373 |
| }, |
| { |
| "epoch": 4.738853503184713, |
| "grad_norm": 0.5656535029411316, |
| "learning_rate": 4.82955423556375e-05, |
| "loss": 1.2665, |
| "mean_token_accuracy": 0.6775676608085632, |
| "num_tokens": 19899824.0, |
| "step": 374 |
| }, |
| { |
| "epoch": 4.751592356687898, |
| "grad_norm": 0.586066722869873, |
| "learning_rate": 4.778812576209241e-05, |
| "loss": 1.2878, |
| "mean_token_accuracy": 0.674250066280365, |
| "num_tokens": 19953139.0, |
| "step": 375 |
| }, |
| { |
| "epoch": 4.764331210191083, |
| "grad_norm": 0.5745534896850586, |
| "learning_rate": 4.728255060360955e-05, |
| "loss": 1.3091, |
| "mean_token_accuracy": 0.6695550978183746, |
| "num_tokens": 20005717.0, |
| "step": 376 |
| }, |
| { |
| "epoch": 4.777070063694268, |
| "grad_norm": 0.5694602727890015, |
| "learning_rate": 4.677883471107193e-05, |
| "loss": 1.3747, |
| "mean_token_accuracy": 0.6596313714981079, |
| "num_tokens": 20061075.0, |
| "step": 377 |
| }, |
| { |
| "epoch": 4.789808917197452, |
| "grad_norm": 0.567896842956543, |
| "learning_rate": 4.6276995849789115e-05, |
| "loss": 1.3263, |
| "mean_token_accuracy": 0.6638911068439484, |
| "num_tokens": 20115574.0, |
| "step": 378 |
| }, |
| { |
| "epoch": 4.802547770700637, |
| "grad_norm": 0.5845338106155396, |
| "learning_rate": 4.57770517188705e-05, |
| "loss": 1.3937, |
| "mean_token_accuracy": 0.6563752293586731, |
| "num_tokens": 20166843.0, |
| "step": 379 |
| }, |
| { |
| "epoch": 4.8152866242038215, |
| "grad_norm": 0.5952852964401245, |
| "learning_rate": 4.527901995060113e-05, |
| "loss": 1.346, |
| "mean_token_accuracy": 0.663836270570755, |
| "num_tokens": 20218952.0, |
| "step": 380 |
| }, |
| { |
| "epoch": 4.828025477707007, |
| "grad_norm": 0.558334469795227, |
| "learning_rate": 4.478291810981998e-05, |
| "loss": 1.3504, |
| "mean_token_accuracy": 0.6601009964942932, |
| "num_tokens": 20277206.0, |
| "step": 381 |
| }, |
| { |
| "epoch": 4.840764331210191, |
| "grad_norm": 0.579488217830658, |
| "learning_rate": 4.428876369330023e-05, |
| "loss": 1.3571, |
| "mean_token_accuracy": 0.6619445979595184, |
| "num_tokens": 20332638.0, |
| "step": 382 |
| }, |
| { |
| "epoch": 4.853503184713376, |
| "grad_norm": 0.5898194909095764, |
| "learning_rate": 4.379657412913243e-05, |
| "loss": 1.3128, |
| "mean_token_accuracy": 0.6692111194133759, |
| "num_tokens": 20387400.0, |
| "step": 383 |
| }, |
| { |
| "epoch": 4.86624203821656, |
| "grad_norm": 0.5899797677993774, |
| "learning_rate": 4.330636677610962e-05, |
| "loss": 1.3015, |
| "mean_token_accuracy": 0.6716260015964508, |
| "num_tokens": 20437836.0, |
| "step": 384 |
| }, |
| { |
| "epoch": 4.8789808917197455, |
| "grad_norm": 0.5910171270370483, |
| "learning_rate": 4.281815892311525e-05, |
| "loss": 1.3263, |
| "mean_token_accuracy": 0.6681764125823975, |
| "num_tokens": 20491880.0, |
| "step": 385 |
| }, |
| { |
| "epoch": 4.89171974522293, |
| "grad_norm": 0.5859639644622803, |
| "learning_rate": 4.2331967788513295e-05, |
| "loss": 1.2936, |
| "mean_token_accuracy": 0.674592137336731, |
| "num_tokens": 20545299.0, |
| "step": 386 |
| }, |
| { |
| "epoch": 4.904458598726115, |
| "grad_norm": 0.5616726279258728, |
| "learning_rate": 4.1847810519541255e-05, |
| "loss": 1.2783, |
| "mean_token_accuracy": 0.6760396957397461, |
| "num_tokens": 20597092.0, |
| "step": 387 |
| }, |
| { |
| "epoch": 4.917197452229299, |
| "grad_norm": 0.585740864276886, |
| "learning_rate": 4.136570419170501e-05, |
| "loss": 1.2801, |
| "mean_token_accuracy": 0.6786915361881256, |
| "num_tokens": 20648729.0, |
| "step": 388 |
| }, |
| { |
| "epoch": 4.929936305732484, |
| "grad_norm": 0.5653679370880127, |
| "learning_rate": 4.088566580817694e-05, |
| "loss": 1.277, |
| "mean_token_accuracy": 0.6827846765518188, |
| "num_tokens": 20700814.0, |
| "step": 389 |
| }, |
| { |
| "epoch": 4.942675159235669, |
| "grad_norm": 0.55994713306427, |
| "learning_rate": 4.040771229919612e-05, |
| "loss": 1.3656, |
| "mean_token_accuracy": 0.6609182953834534, |
| "num_tokens": 20757340.0, |
| "step": 390 |
| }, |
| { |
| "epoch": 4.955414012738854, |
| "grad_norm": 0.5757020115852356, |
| "learning_rate": 3.99318605214711e-05, |
| "loss": 1.3236, |
| "mean_token_accuracy": 0.6677860915660858, |
| "num_tokens": 20810088.0, |
| "step": 391 |
| }, |
| { |
| "epoch": 4.968152866242038, |
| "grad_norm": 0.5951821208000183, |
| "learning_rate": 3.945812725758554e-05, |
| "loss": 1.1905, |
| "mean_token_accuracy": 0.6992946565151215, |
| "num_tokens": 20857926.0, |
| "step": 392 |
| }, |
| { |
| "epoch": 4.980891719745223, |
| "grad_norm": 0.5893043875694275, |
| "learning_rate": 3.8986529215406275e-05, |
| "loss": 1.3325, |
| "mean_token_accuracy": 0.6695416867733002, |
| "num_tokens": 20913912.0, |
| "step": 393 |
| }, |
| { |
| "epoch": 4.993630573248407, |
| "grad_norm": 0.5932007431983948, |
| "learning_rate": 3.851708302749409e-05, |
| "loss": 1.347, |
| "mean_token_accuracy": 0.6626794338226318, |
| "num_tokens": 20964604.0, |
| "step": 394 |
| }, |
| { |
| "epoch": 5.0, |
| "grad_norm": 0.5932007431983948, |
| "learning_rate": 3.8049805250517004e-05, |
| "loss": 1.1922, |
| "mean_token_accuracy": 0.6985917687416077, |
| "num_tokens": 20990342.0, |
| "step": 395 |
| }, |
| { |
| "epoch": 5.012738853503185, |
| "grad_norm": 0.949424684047699, |
| "learning_rate": 3.7584712364666494e-05, |
| "loss": 1.0667, |
| "mean_token_accuracy": 0.7288348972797394, |
| "num_tokens": 21043351.0, |
| "step": 396 |
| }, |
| { |
| "epoch": 5.025477707006369, |
| "grad_norm": 0.6719571948051453, |
| "learning_rate": 3.71218207730761e-05, |
| "loss": 1.0423, |
| "mean_token_accuracy": 0.7332281470298767, |
| "num_tokens": 21099798.0, |
| "step": 397 |
| }, |
| { |
| "epoch": 5.038216560509555, |
| "grad_norm": 0.6320285201072693, |
| "learning_rate": 3.666114680124298e-05, |
| "loss": 1.044, |
| "mean_token_accuracy": 0.7290763556957245, |
| "num_tokens": 21155288.0, |
| "step": 398 |
| }, |
| { |
| "epoch": 5.050955414012739, |
| "grad_norm": 0.6851104497909546, |
| "learning_rate": 3.620270669645228e-05, |
| "loss": 1.0028, |
| "mean_token_accuracy": 0.7407164871692657, |
| "num_tokens": 21206003.0, |
| "step": 399 |
| }, |
| { |
| "epoch": 5.063694267515924, |
| "grad_norm": 0.9430750012397766, |
| "learning_rate": 3.574651662720382e-05, |
| "loss": 1.1002, |
| "mean_token_accuracy": 0.7209575474262238, |
| "num_tokens": 21254270.0, |
| "step": 400 |
| }, |
| { |
| "epoch": 5.076433121019108, |
| "grad_norm": 0.9766407012939453, |
| "learning_rate": 3.5292592682642134e-05, |
| "loss": 1.0574, |
| "mean_token_accuracy": 0.7294503152370453, |
| "num_tokens": 21305776.0, |
| "step": 401 |
| }, |
| { |
| "epoch": 5.089171974522293, |
| "grad_norm": 0.8267378211021423, |
| "learning_rate": 3.484095087198881e-05, |
| "loss": 0.9911, |
| "mean_token_accuracy": 0.7402434647083282, |
| "num_tokens": 21358915.0, |
| "step": 402 |
| }, |
| { |
| "epoch": 5.101910828025478, |
| "grad_norm": 0.6997200846672058, |
| "learning_rate": 3.4391607123978095e-05, |
| "loss": 1.0519, |
| "mean_token_accuracy": 0.7285727858543396, |
| "num_tokens": 21414467.0, |
| "step": 403 |
| }, |
| { |
| "epoch": 5.114649681528663, |
| "grad_norm": 0.6674304008483887, |
| "learning_rate": 3.394457728629489e-05, |
| "loss": 1.0384, |
| "mean_token_accuracy": 0.7353217601776123, |
| "num_tokens": 21468454.0, |
| "step": 404 |
| }, |
| { |
| "epoch": 5.127388535031847, |
| "grad_norm": 0.6918561458587646, |
| "learning_rate": 3.349987712501591e-05, |
| "loss": 1.0789, |
| "mean_token_accuracy": 0.7234221994876862, |
| "num_tokens": 21520736.0, |
| "step": 405 |
| }, |
| { |
| "epoch": 5.140127388535032, |
| "grad_norm": 0.6514602303504944, |
| "learning_rate": 3.305752232405377e-05, |
| "loss": 1.0712, |
| "mean_token_accuracy": 0.7242619395256042, |
| "num_tokens": 21577404.0, |
| "step": 406 |
| }, |
| { |
| "epoch": 5.1528662420382165, |
| "grad_norm": 0.6595425009727478, |
| "learning_rate": 3.2617528484603576e-05, |
| "loss": 1.0613, |
| "mean_token_accuracy": 0.7305818200111389, |
| "num_tokens": 21628435.0, |
| "step": 407 |
| }, |
| { |
| "epoch": 5.165605095541402, |
| "grad_norm": 0.6778191328048706, |
| "learning_rate": 3.2179911124592966e-05, |
| "loss": 1.1052, |
| "mean_token_accuracy": 0.7213633954524994, |
| "num_tokens": 21680995.0, |
| "step": 408 |
| }, |
| { |
| "epoch": 5.178343949044586, |
| "grad_norm": 0.6973161697387695, |
| "learning_rate": 3.174468567813461e-05, |
| "loss": 1.1133, |
| "mean_token_accuracy": 0.7150149345397949, |
| "num_tokens": 21736978.0, |
| "step": 409 |
| }, |
| { |
| "epoch": 5.191082802547771, |
| "grad_norm": 0.692443311214447, |
| "learning_rate": 3.131186749498195e-05, |
| "loss": 1.0405, |
| "mean_token_accuracy": 0.7330755889415741, |
| "num_tokens": 21790319.0, |
| "step": 410 |
| }, |
| { |
| "epoch": 5.203821656050955, |
| "grad_norm": 0.7503440976142883, |
| "learning_rate": 3.088147183998782e-05, |
| "loss": 1.101, |
| "mean_token_accuracy": 0.7169683575630188, |
| "num_tokens": 21847683.0, |
| "step": 411 |
| }, |
| { |
| "epoch": 5.2165605095541405, |
| "grad_norm": 0.7656980752944946, |
| "learning_rate": 3.0453513892566197e-05, |
| "loss": 1.1012, |
| "mean_token_accuracy": 0.718243807554245, |
| "num_tokens": 21900904.0, |
| "step": 412 |
| }, |
| { |
| "epoch": 5.229299363057325, |
| "grad_norm": 0.75949627161026, |
| "learning_rate": 3.0028008746156588e-05, |
| "loss": 1.0325, |
| "mean_token_accuracy": 0.7328855395317078, |
| "num_tokens": 21955480.0, |
| "step": 413 |
| }, |
| { |
| "epoch": 5.24203821656051, |
| "grad_norm": 0.6977457404136658, |
| "learning_rate": 2.9604971407692027e-05, |
| "loss": 1.0006, |
| "mean_token_accuracy": 0.7438418865203857, |
| "num_tokens": 22007429.0, |
| "step": 414 |
| }, |
| { |
| "epoch": 5.254777070063694, |
| "grad_norm": 0.683573305606842, |
| "learning_rate": 2.918441679706949e-05, |
| "loss": 1.0567, |
| "mean_token_accuracy": 0.7246206998825073, |
| "num_tokens": 22060919.0, |
| "step": 415 |
| }, |
| { |
| "epoch": 5.267515923566879, |
| "grad_norm": 0.6628759503364563, |
| "learning_rate": 2.8766359746623894e-05, |
| "loss": 1.0472, |
| "mean_token_accuracy": 0.7305993735790253, |
| "num_tokens": 22116025.0, |
| "step": 416 |
| }, |
| { |
| "epoch": 5.280254777070064, |
| "grad_norm": 0.6662408113479614, |
| "learning_rate": 2.835081500060498e-05, |
| "loss": 1.0659, |
| "mean_token_accuracy": 0.7216311395168304, |
| "num_tokens": 22173468.0, |
| "step": 417 |
| }, |
| { |
| "epoch": 5.292993630573249, |
| "grad_norm": 0.6621999740600586, |
| "learning_rate": 2.7937797214657147e-05, |
| "loss": 1.0885, |
| "mean_token_accuracy": 0.7194872796535492, |
| "num_tokens": 22224551.0, |
| "step": 418 |
| }, |
| { |
| "epoch": 5.305732484076433, |
| "grad_norm": 0.6753632426261902, |
| "learning_rate": 2.7527320955302794e-05, |
| "loss": 1.1291, |
| "mean_token_accuracy": 0.71415114402771, |
| "num_tokens": 22281211.0, |
| "step": 419 |
| }, |
| { |
| "epoch": 5.318471337579618, |
| "grad_norm": 0.6937434673309326, |
| "learning_rate": 2.7119400699428332e-05, |
| "loss": 1.0538, |
| "mean_token_accuracy": 0.733318418264389, |
| "num_tokens": 22334922.0, |
| "step": 420 |
| }, |
| { |
| "epoch": 5.3312101910828025, |
| "grad_norm": 0.6540622115135193, |
| "learning_rate": 2.671405083377386e-05, |
| "loss": 1.0844, |
| "mean_token_accuracy": 0.72323277592659, |
| "num_tokens": 22390386.0, |
| "step": 421 |
| }, |
| { |
| "epoch": 5.343949044585988, |
| "grad_norm": 0.7267047166824341, |
| "learning_rate": 2.6311285654425575e-05, |
| "loss": 1.0843, |
| "mean_token_accuracy": 0.7220070958137512, |
| "num_tokens": 22444403.0, |
| "step": 422 |
| }, |
| { |
| "epoch": 5.356687898089172, |
| "grad_norm": 0.7183628082275391, |
| "learning_rate": 2.5911119366311597e-05, |
| "loss": 1.0139, |
| "mean_token_accuracy": 0.7385392785072327, |
| "num_tokens": 22495710.0, |
| "step": 423 |
| }, |
| { |
| "epoch": 5.369426751592357, |
| "grad_norm": 0.7213277816772461, |
| "learning_rate": 2.5513566082701135e-05, |
| "loss": 1.0277, |
| "mean_token_accuracy": 0.73272305727005, |
| "num_tokens": 22547607.0, |
| "step": 424 |
| }, |
| { |
| "epoch": 5.382165605095541, |
| "grad_norm": 0.681786835193634, |
| "learning_rate": 2.51186398247065e-05, |
| "loss": 1.041, |
| "mean_token_accuracy": 0.731095016002655, |
| "num_tokens": 22597922.0, |
| "step": 425 |
| }, |
| { |
| "epoch": 5.3949044585987265, |
| "grad_norm": 0.6919716000556946, |
| "learning_rate": 2.472635452078883e-05, |
| "loss": 0.972, |
| "mean_token_accuracy": 0.7483727931976318, |
| "num_tokens": 22650033.0, |
| "step": 426 |
| }, |
| { |
| "epoch": 5.407643312101911, |
| "grad_norm": 0.7305470705032349, |
| "learning_rate": 2.433672400626663e-05, |
| "loss": 1.0467, |
| "mean_token_accuracy": 0.7295823395252228, |
| "num_tokens": 22706010.0, |
| "step": 427 |
| }, |
| { |
| "epoch": 5.420382165605096, |
| "grad_norm": 0.6791853308677673, |
| "learning_rate": 2.3949762022828092e-05, |
| "loss": 1.0977, |
| "mean_token_accuracy": 0.7203018963336945, |
| "num_tokens": 22760612.0, |
| "step": 428 |
| }, |
| { |
| "epoch": 5.43312101910828, |
| "grad_norm": 0.6604982614517212, |
| "learning_rate": 2.3565482218046075e-05, |
| "loss": 1.0449, |
| "mean_token_accuracy": 0.731783002614975, |
| "num_tokens": 22813906.0, |
| "step": 429 |
| }, |
| { |
| "epoch": 5.445859872611465, |
| "grad_norm": 0.6988003849983215, |
| "learning_rate": 2.3183898144897177e-05, |
| "loss": 1.0357, |
| "mean_token_accuracy": 0.7282467782497406, |
| "num_tokens": 22866208.0, |
| "step": 430 |
| }, |
| { |
| "epoch": 5.45859872611465, |
| "grad_norm": 0.6916972994804382, |
| "learning_rate": 2.2805023261283497e-05, |
| "loss": 1.0633, |
| "mean_token_accuracy": 0.728242814540863, |
| "num_tokens": 22921899.0, |
| "step": 431 |
| }, |
| { |
| "epoch": 5.471337579617835, |
| "grad_norm": 0.6968501210212708, |
| "learning_rate": 2.242887092955801e-05, |
| "loss": 1.0373, |
| "mean_token_accuracy": 0.7322342693805695, |
| "num_tokens": 22976617.0, |
| "step": 432 |
| }, |
| { |
| "epoch": 5.484076433121019, |
| "grad_norm": 0.675930917263031, |
| "learning_rate": 2.2055454416053422e-05, |
| "loss": 1.1002, |
| "mean_token_accuracy": 0.7181484699249268, |
| "num_tokens": 23032361.0, |
| "step": 433 |
| }, |
| { |
| "epoch": 5.496815286624204, |
| "grad_norm": 0.6669013500213623, |
| "learning_rate": 2.168478689061413e-05, |
| "loss": 1.0731, |
| "mean_token_accuracy": 0.722827821969986, |
| "num_tokens": 23084812.0, |
| "step": 434 |
| }, |
| { |
| "epoch": 5.509554140127388, |
| "grad_norm": 0.7085078358650208, |
| "learning_rate": 2.131688142613183e-05, |
| "loss": 1.088, |
| "mean_token_accuracy": 0.7204846441745758, |
| "num_tokens": 23138306.0, |
| "step": 435 |
| }, |
| { |
| "epoch": 5.522292993630574, |
| "grad_norm": 0.7120036482810974, |
| "learning_rate": 2.095175099808444e-05, |
| "loss": 1.0151, |
| "mean_token_accuracy": 0.7386319637298584, |
| "num_tokens": 23191964.0, |
| "step": 436 |
| }, |
| { |
| "epoch": 5.535031847133758, |
| "grad_norm": 0.6772408485412598, |
| "learning_rate": 2.058940848407854e-05, |
| "loss": 1.0955, |
| "mean_token_accuracy": 0.7194060981273651, |
| "num_tokens": 23247106.0, |
| "step": 437 |
| }, |
| { |
| "epoch": 5.547770700636943, |
| "grad_norm": 0.6788638234138489, |
| "learning_rate": 2.0229866663395026e-05, |
| "loss": 1.0669, |
| "mean_token_accuracy": 0.7293340563774109, |
| "num_tokens": 23304763.0, |
| "step": 438 |
| }, |
| { |
| "epoch": 5.560509554140127, |
| "grad_norm": 0.6700994968414307, |
| "learning_rate": 1.987313821653861e-05, |
| "loss": 1.0693, |
| "mean_token_accuracy": 0.7236025929450989, |
| "num_tokens": 23358531.0, |
| "step": 439 |
| }, |
| { |
| "epoch": 5.573248407643312, |
| "grad_norm": 0.6899035573005676, |
| "learning_rate": 1.951923572479044e-05, |
| "loss": 1.0717, |
| "mean_token_accuracy": 0.7225435674190521, |
| "num_tokens": 23410673.0, |
| "step": 440 |
| }, |
| { |
| "epoch": 5.585987261146497, |
| "grad_norm": 0.7207638025283813, |
| "learning_rate": 1.9168171669764413e-05, |
| "loss": 1.0653, |
| "mean_token_accuracy": 0.7253636419773102, |
| "num_tokens": 23462065.0, |
| "step": 441 |
| }, |
| { |
| "epoch": 5.598726114649682, |
| "grad_norm": 0.6701375246047974, |
| "learning_rate": 1.881995843296708e-05, |
| "loss": 1.0593, |
| "mean_token_accuracy": 0.728567361831665, |
| "num_tokens": 23516117.0, |
| "step": 442 |
| }, |
| { |
| "epoch": 5.611464968152866, |
| "grad_norm": 0.7424018979072571, |
| "learning_rate": 1.847460829536075e-05, |
| "loss": 1.043, |
| "mean_token_accuracy": 0.7317372858524323, |
| "num_tokens": 23567722.0, |
| "step": 443 |
| }, |
| { |
| "epoch": 5.624203821656051, |
| "grad_norm": 0.6817992329597473, |
| "learning_rate": 1.8132133436930642e-05, |
| "loss": 1.0661, |
| "mean_token_accuracy": 0.7273876368999481, |
| "num_tokens": 23618132.0, |
| "step": 444 |
| }, |
| { |
| "epoch": 5.6369426751592355, |
| "grad_norm": 0.7347919940948486, |
| "learning_rate": 1.7792545936255013e-05, |
| "loss": 1.0253, |
| "mean_token_accuracy": 0.7398423254489899, |
| "num_tokens": 23669306.0, |
| "step": 445 |
| }, |
| { |
| "epoch": 5.649681528662421, |
| "grad_norm": 0.7186480760574341, |
| "learning_rate": 1.745585777007943e-05, |
| "loss": 1.0957, |
| "mean_token_accuracy": 0.7136403024196625, |
| "num_tokens": 23720872.0, |
| "step": 446 |
| }, |
| { |
| "epoch": 5.662420382165605, |
| "grad_norm": 0.7350268363952637, |
| "learning_rate": 1.7122080812894147e-05, |
| "loss": 1.0426, |
| "mean_token_accuracy": 0.7309506833553314, |
| "num_tokens": 23770877.0, |
| "step": 447 |
| }, |
| { |
| "epoch": 5.67515923566879, |
| "grad_norm": 0.7014331221580505, |
| "learning_rate": 1.679122683651546e-05, |
| "loss": 1.0368, |
| "mean_token_accuracy": 0.7311596572399139, |
| "num_tokens": 23825380.0, |
| "step": 448 |
| }, |
| { |
| "epoch": 5.687898089171974, |
| "grad_norm": 0.6853126287460327, |
| "learning_rate": 1.6463307509670524e-05, |
| "loss": 1.0884, |
| "mean_token_accuracy": 0.7230669856071472, |
| "num_tokens": 23881723.0, |
| "step": 449 |
| }, |
| { |
| "epoch": 5.7006369426751595, |
| "grad_norm": 0.6790868639945984, |
| "learning_rate": 1.6138334397585675e-05, |
| "loss": 1.0867, |
| "mean_token_accuracy": 0.7211387157440186, |
| "num_tokens": 23932575.0, |
| "step": 450 |
| }, |
| { |
| "epoch": 5.713375796178344, |
| "grad_norm": 0.6989074349403381, |
| "learning_rate": 1.5816318961578757e-05, |
| "loss": 1.0749, |
| "mean_token_accuracy": 0.7248625159263611, |
| "num_tokens": 23986604.0, |
| "step": 451 |
| }, |
| { |
| "epoch": 5.726114649681529, |
| "grad_norm": 0.6707603335380554, |
| "learning_rate": 1.5497272558654697e-05, |
| "loss": 1.0905, |
| "mean_token_accuracy": 0.7167878448963165, |
| "num_tokens": 24041358.0, |
| "step": 452 |
| }, |
| { |
| "epoch": 5.738853503184713, |
| "grad_norm": 0.660871684551239, |
| "learning_rate": 1.5181206441105078e-05, |
| "loss": 1.0816, |
| "mean_token_accuracy": 0.7231634855270386, |
| "num_tokens": 24095743.0, |
| "step": 453 |
| }, |
| { |
| "epoch": 5.751592356687898, |
| "grad_norm": 0.7151232361793518, |
| "learning_rate": 1.4868131756111225e-05, |
| "loss": 1.1497, |
| "mean_token_accuracy": 0.7055739164352417, |
| "num_tokens": 24150288.0, |
| "step": 454 |
| }, |
| { |
| "epoch": 5.764331210191083, |
| "grad_norm": 0.6802468299865723, |
| "learning_rate": 1.4558059545351143e-05, |
| "loss": 1.039, |
| "mean_token_accuracy": 0.7299814522266388, |
| "num_tokens": 24201891.0, |
| "step": 455 |
| }, |
| { |
| "epoch": 5.777070063694268, |
| "grad_norm": 0.6844266057014465, |
| "learning_rate": 1.4251000744610033e-05, |
| "loss": 1.0699, |
| "mean_token_accuracy": 0.7259117960929871, |
| "num_tokens": 24255851.0, |
| "step": 456 |
| }, |
| { |
| "epoch": 5.789808917197452, |
| "grad_norm": 0.696475088596344, |
| "learning_rate": 1.394696618339456e-05, |
| "loss": 1.0644, |
| "mean_token_accuracy": 0.7264423072338104, |
| "num_tokens": 24309588.0, |
| "step": 457 |
| }, |
| { |
| "epoch": 5.802547770700637, |
| "grad_norm": 0.7226197719573975, |
| "learning_rate": 1.364596658455105e-05, |
| "loss": 1.0641, |
| "mean_token_accuracy": 0.7255161702632904, |
| "num_tokens": 24358590.0, |
| "step": 458 |
| }, |
| { |
| "epoch": 5.8152866242038215, |
| "grad_norm": 0.6717948913574219, |
| "learning_rate": 1.3348012563887102e-05, |
| "loss": 1.1188, |
| "mean_token_accuracy": 0.7094634771347046, |
| "num_tokens": 24410628.0, |
| "step": 459 |
| }, |
| { |
| "epoch": 5.828025477707007, |
| "grad_norm": 0.7298137545585632, |
| "learning_rate": 1.3053114629797437e-05, |
| "loss": 1.069, |
| "mean_token_accuracy": 0.7227195501327515, |
| "num_tokens": 24465228.0, |
| "step": 460 |
| }, |
| { |
| "epoch": 5.840764331210191, |
| "grad_norm": 0.70267254114151, |
| "learning_rate": 1.2761283182893047e-05, |
| "loss": 1.0563, |
| "mean_token_accuracy": 0.7271043360233307, |
| "num_tokens": 24519413.0, |
| "step": 461 |
| }, |
| { |
| "epoch": 5.853503184713376, |
| "grad_norm": 0.6809209585189819, |
| "learning_rate": 1.2472528515634584e-05, |
| "loss": 1.1122, |
| "mean_token_accuracy": 0.7165907919406891, |
| "num_tokens": 24576407.0, |
| "step": 462 |
| }, |
| { |
| "epoch": 5.86624203821656, |
| "grad_norm": 0.6934412717819214, |
| "learning_rate": 1.218686081196917e-05, |
| "loss": 1.0996, |
| "mean_token_accuracy": 0.7188406884670258, |
| "num_tokens": 24631633.0, |
| "step": 463 |
| }, |
| { |
| "epoch": 5.8789808917197455, |
| "grad_norm": 0.6762963533401489, |
| "learning_rate": 1.1904290146971397e-05, |
| "loss": 1.0957, |
| "mean_token_accuracy": 0.7170492112636566, |
| "num_tokens": 24685441.0, |
| "step": 464 |
| }, |
| { |
| "epoch": 5.89171974522293, |
| "grad_norm": 0.7013036012649536, |
| "learning_rate": 1.1624826486487871e-05, |
| "loss": 1.1055, |
| "mean_token_accuracy": 0.7152808904647827, |
| "num_tokens": 24739978.0, |
| "step": 465 |
| }, |
| { |
| "epoch": 5.904458598726115, |
| "grad_norm": 0.6889830231666565, |
| "learning_rate": 1.1348479686785751e-05, |
| "loss": 0.9799, |
| "mean_token_accuracy": 0.7468411326408386, |
| "num_tokens": 24791608.0, |
| "step": 466 |
| }, |
| { |
| "epoch": 5.917197452229299, |
| "grad_norm": 0.6898278594017029, |
| "learning_rate": 1.1075259494205225e-05, |
| "loss": 1.1051, |
| "mean_token_accuracy": 0.7165685892105103, |
| "num_tokens": 24844829.0, |
| "step": 467 |
| }, |
| { |
| "epoch": 5.929936305732484, |
| "grad_norm": 0.7092660665512085, |
| "learning_rate": 1.0805175544815648e-05, |
| "loss": 1.0596, |
| "mean_token_accuracy": 0.7260420620441437, |
| "num_tokens": 24896024.0, |
| "step": 468 |
| }, |
| { |
| "epoch": 5.942675159235669, |
| "grad_norm": 0.6775749921798706, |
| "learning_rate": 1.0538237364075787e-05, |
| "loss": 1.0825, |
| "mean_token_accuracy": 0.7203651666641235, |
| "num_tokens": 24949324.0, |
| "step": 469 |
| }, |
| { |
| "epoch": 5.955414012738854, |
| "grad_norm": 0.6780968308448792, |
| "learning_rate": 1.0274454366497787e-05, |
| "loss": 1.0594, |
| "mean_token_accuracy": 0.7282997369766235, |
| "num_tokens": 25000988.0, |
| "step": 470 |
| }, |
| { |
| "epoch": 5.968152866242038, |
| "grad_norm": 0.7077444195747375, |
| "learning_rate": 1.0013835855315235e-05, |
| "loss": 1.0463, |
| "mean_token_accuracy": 0.7352750301361084, |
| "num_tokens": 25051001.0, |
| "step": 471 |
| }, |
| { |
| "epoch": 5.980891719745223, |
| "grad_norm": 0.6713427305221558, |
| "learning_rate": 9.756391022154954e-06, |
| "loss": 1.0665, |
| "mean_token_accuracy": 0.7268872261047363, |
| "num_tokens": 25107428.0, |
| "step": 472 |
| }, |
| { |
| "epoch": 5.993630573248407, |
| "grad_norm": 0.6871688961982727, |
| "learning_rate": 9.502128946712862e-06, |
| "loss": 1.0956, |
| "mean_token_accuracy": 0.7180374562740326, |
| "num_tokens": 25162781.0, |
| "step": 473 |
| }, |
| { |
| "epoch": 6.0, |
| "grad_norm": 1.0545368194580078, |
| "learning_rate": 9.251058596433793e-06, |
| "loss": 0.9163, |
| "mean_token_accuracy": 0.7619118690490723, |
| "num_tokens": 25189656.0, |
| "step": 474 |
| }, |
| { |
| "epoch": 6.012738853503185, |
| "grad_norm": 0.7146143913269043, |
| "learning_rate": 9.003188826195142e-06, |
| "loss": 0.9193, |
| "mean_token_accuracy": 0.7621127963066101, |
| "num_tokens": 25240863.0, |
| "step": 475 |
| }, |
| { |
| "epoch": 6.025477707006369, |
| "grad_norm": 0.7108073830604553, |
| "learning_rate": 8.758528377994667e-06, |
| "loss": 0.96, |
| "mean_token_accuracy": 0.7582462728023529, |
| "num_tokens": 25294260.0, |
| "step": 476 |
| }, |
| { |
| "epoch": 6.038216560509555, |
| "grad_norm": 0.6869873404502869, |
| "learning_rate": 8.517085880642062e-06, |
| "loss": 0.9756, |
| "mean_token_accuracy": 0.749285876750946, |
| "num_tokens": 25348579.0, |
| "step": 477 |
| }, |
| { |
| "epoch": 6.050955414012739, |
| "grad_norm": 0.6845804452896118, |
| "learning_rate": 8.278869849454718e-06, |
| "loss": 0.8822, |
| "mean_token_accuracy": 0.7715561091899872, |
| "num_tokens": 25401401.0, |
| "step": 478 |
| }, |
| { |
| "epoch": 6.063694267515924, |
| "grad_norm": 0.6910164952278137, |
| "learning_rate": 8.043888685957313e-06, |
| "loss": 0.9433, |
| "mean_token_accuracy": 0.7562872767448425, |
| "num_tokens": 25454769.0, |
| "step": 479 |
| }, |
| { |
| "epoch": 6.076433121019108, |
| "grad_norm": 0.7341907620429993, |
| "learning_rate": 7.812150677585673e-06, |
| "loss": 0.9085, |
| "mean_token_accuracy": 0.7656155228614807, |
| "num_tokens": 25506726.0, |
| "step": 480 |
| }, |
| { |
| "epoch": 6.089171974522293, |
| "grad_norm": 0.781583845615387, |
| "learning_rate": 7.583663997394241e-06, |
| "loss": 0.8805, |
| "mean_token_accuracy": 0.7671515941619873, |
| "num_tokens": 25557160.0, |
| "step": 481 |
| }, |
| { |
| "epoch": 6.101910828025478, |
| "grad_norm": 0.8239176273345947, |
| "learning_rate": 7.358436703768035e-06, |
| "loss": 0.9748, |
| "mean_token_accuracy": 0.7472788989543915, |
| "num_tokens": 25610789.0, |
| "step": 482 |
| }, |
| { |
| "epoch": 6.114649681528663, |
| "grad_norm": 0.8466070890426636, |
| "learning_rate": 7.136476740138387e-06, |
| "loss": 0.993, |
| "mean_token_accuracy": 0.7422117292881012, |
| "num_tokens": 25665950.0, |
| "step": 483 |
| }, |
| { |
| "epoch": 6.127388535031847, |
| "grad_norm": 0.8602212071418762, |
| "learning_rate": 6.917791934702655e-06, |
| "loss": 0.9483, |
| "mean_token_accuracy": 0.7557033598423004, |
| "num_tokens": 25718919.0, |
| "step": 484 |
| }, |
| { |
| "epoch": 6.140127388535032, |
| "grad_norm": 0.8259091377258301, |
| "learning_rate": 6.702390000148351e-06, |
| "loss": 0.8463, |
| "mean_token_accuracy": 0.777842104434967, |
| "num_tokens": 25767903.0, |
| "step": 485 |
| }, |
| { |
| "epoch": 6.1528662420382165, |
| "grad_norm": 0.8399609327316284, |
| "learning_rate": 6.490278533380956e-06, |
| "loss": 0.9647, |
| "mean_token_accuracy": 0.7500897943973541, |
| "num_tokens": 25822750.0, |
| "step": 486 |
| }, |
| { |
| "epoch": 6.165605095541402, |
| "grad_norm": 0.7666255831718445, |
| "learning_rate": 6.281465015256094e-06, |
| "loss": 0.9125, |
| "mean_token_accuracy": 0.7626084089279175, |
| "num_tokens": 25874905.0, |
| "step": 487 |
| }, |
| { |
| "epoch": 6.178343949044586, |
| "grad_norm": 0.7555410265922546, |
| "learning_rate": 6.0759568103156195e-06, |
| "loss": 0.7986, |
| "mean_token_accuracy": 0.7909380793571472, |
| "num_tokens": 25925230.0, |
| "step": 488 |
| }, |
| { |
| "epoch": 6.191082802547771, |
| "grad_norm": 0.7381100058555603, |
| "learning_rate": 5.873761166527936e-06, |
| "loss": 0.9506, |
| "mean_token_accuracy": 0.7554153203964233, |
| "num_tokens": 25977993.0, |
| "step": 489 |
| }, |
| { |
| "epoch": 6.203821656050955, |
| "grad_norm": 0.7189981937408447, |
| "learning_rate": 5.674885215032322e-06, |
| "loss": 0.87, |
| "mean_token_accuracy": 0.7736336588859558, |
| "num_tokens": 26031705.0, |
| "step": 490 |
| }, |
| { |
| "epoch": 6.2165605095541405, |
| "grad_norm": 0.7386711239814758, |
| "learning_rate": 5.479335969887467e-06, |
| "loss": 0.9832, |
| "mean_token_accuracy": 0.7475563585758209, |
| "num_tokens": 26083671.0, |
| "step": 491 |
| }, |
| { |
| "epoch": 6.229299363057325, |
| "grad_norm": 0.7135651111602783, |
| "learning_rate": 5.287120327824091e-06, |
| "loss": 0.94, |
| "mean_token_accuracy": 0.7552074790000916, |
| "num_tokens": 26135859.0, |
| "step": 492 |
| }, |
| { |
| "epoch": 6.24203821656051, |
| "grad_norm": 0.7520937323570251, |
| "learning_rate": 5.098245068001661e-06, |
| "loss": 0.8988, |
| "mean_token_accuracy": 0.7664923667907715, |
| "num_tokens": 26184826.0, |
| "step": 493 |
| }, |
| { |
| "epoch": 6.254777070063694, |
| "grad_norm": 0.7178412675857544, |
| "learning_rate": 4.9127168517693946e-06, |
| "loss": 0.9459, |
| "mean_token_accuracy": 0.7564821839332581, |
| "num_tokens": 26239493.0, |
| "step": 494 |
| }, |
| { |
| "epoch": 6.267515923566879, |
| "grad_norm": 0.701515793800354, |
| "learning_rate": 4.730542222431223e-06, |
| "loss": 0.9265, |
| "mean_token_accuracy": 0.7591147124767303, |
| "num_tokens": 26294426.0, |
| "step": 495 |
| }, |
| { |
| "epoch": 6.280254777070064, |
| "grad_norm": 0.7227333784103394, |
| "learning_rate": 4.551727605015032e-06, |
| "loss": 0.937, |
| "mean_token_accuracy": 0.7586305141448975, |
| "num_tokens": 26346551.0, |
| "step": 496 |
| }, |
| { |
| "epoch": 6.292993630573249, |
| "grad_norm": 0.7054842114448547, |
| "learning_rate": 4.376279306046183e-06, |
| "loss": 0.9727, |
| "mean_token_accuracy": 0.7496200203895569, |
| "num_tokens": 26401101.0, |
| "step": 497 |
| }, |
| { |
| "epoch": 6.305732484076433, |
| "grad_norm": 0.7149825692176819, |
| "learning_rate": 4.2042035133248895e-06, |
| "loss": 0.921, |
| "mean_token_accuracy": 0.7641755938529968, |
| "num_tokens": 26451879.0, |
| "step": 498 |
| }, |
| { |
| "epoch": 6.318471337579618, |
| "grad_norm": 0.6818841695785522, |
| "learning_rate": 4.035506295708191e-06, |
| "loss": 0.9648, |
| "mean_token_accuracy": 0.74892657995224, |
| "num_tokens": 26509991.0, |
| "step": 499 |
| }, |
| { |
| "epoch": 6.3312101910828025, |
| "grad_norm": 0.717536211013794, |
| "learning_rate": 3.870193602895733e-06, |
| "loss": 0.8917, |
| "mean_token_accuracy": 0.7688518166542053, |
| "num_tokens": 26563939.0, |
| "step": 500 |
| }, |
| { |
| "epoch": 6.343949044585988, |
| "grad_norm": 0.7026060819625854, |
| "learning_rate": 3.7082712652200867e-06, |
| "loss": 0.8955, |
| "mean_token_accuracy": 0.7676977217197418, |
| "num_tokens": 26618063.0, |
| "step": 501 |
| }, |
| { |
| "epoch": 6.356687898089172, |
| "grad_norm": 0.7318772673606873, |
| "learning_rate": 3.54974499344094e-06, |
| "loss": 0.8681, |
| "mean_token_accuracy": 0.7763055860996246, |
| "num_tokens": 26669002.0, |
| "step": 502 |
| }, |
| { |
| "epoch": 6.369426751592357, |
| "grad_norm": 0.7441863417625427, |
| "learning_rate": 3.3946203785439113e-06, |
| "loss": 0.9924, |
| "mean_token_accuracy": 0.7483593821525574, |
| "num_tokens": 26721230.0, |
| "step": 503 |
| }, |
| { |
| "epoch": 6.382165605095541, |
| "grad_norm": 0.7195377349853516, |
| "learning_rate": 3.2429028915431534e-06, |
| "loss": 0.9839, |
| "mean_token_accuracy": 0.7457345724105835, |
| "num_tokens": 26776267.0, |
| "step": 504 |
| }, |
| { |
| "epoch": 6.3949044585987265, |
| "grad_norm": 0.7469968795776367, |
| "learning_rate": 3.094597883288575e-06, |
| "loss": 0.9288, |
| "mean_token_accuracy": 0.7621110081672668, |
| "num_tokens": 26826994.0, |
| "step": 505 |
| }, |
| { |
| "epoch": 6.407643312101911, |
| "grad_norm": 0.73201584815979, |
| "learning_rate": 2.9497105842769435e-06, |
| "loss": 0.9608, |
| "mean_token_accuracy": 0.7524427771568298, |
| "num_tokens": 26881841.0, |
| "step": 506 |
| }, |
| { |
| "epoch": 6.420382165605096, |
| "grad_norm": 0.7143669128417969, |
| "learning_rate": 2.808246104467582e-06, |
| "loss": 0.969, |
| "mean_token_accuracy": 0.7490289807319641, |
| "num_tokens": 26937886.0, |
| "step": 507 |
| }, |
| { |
| "epoch": 6.43312101910828, |
| "grad_norm": 0.725846529006958, |
| "learning_rate": 2.6702094331020887e-06, |
| "loss": 0.8699, |
| "mean_token_accuracy": 0.774571418762207, |
| "num_tokens": 26992609.0, |
| "step": 508 |
| }, |
| { |
| "epoch": 6.445859872611465, |
| "grad_norm": 0.7519891262054443, |
| "learning_rate": 2.5356054385282766e-06, |
| "loss": 0.9874, |
| "mean_token_accuracy": 0.745583564043045, |
| "num_tokens": 27048708.0, |
| "step": 509 |
| }, |
| { |
| "epoch": 6.45859872611465, |
| "grad_norm": 0.7535760402679443, |
| "learning_rate": 2.404438868028658e-06, |
| "loss": 0.9721, |
| "mean_token_accuracy": 0.7467173933982849, |
| "num_tokens": 27100485.0, |
| "step": 510 |
| }, |
| { |
| "epoch": 6.471337579617835, |
| "grad_norm": 0.7484342455863953, |
| "learning_rate": 2.276714347652831e-06, |
| "loss": 0.9892, |
| "mean_token_accuracy": 0.742410272359848, |
| "num_tokens": 27155364.0, |
| "step": 511 |
| }, |
| { |
| "epoch": 6.484076433121019, |
| "grad_norm": 0.76715487241745, |
| "learning_rate": 2.152436382054479e-06, |
| "loss": 0.9417, |
| "mean_token_accuracy": 0.7548108398914337, |
| "num_tokens": 27207302.0, |
| "step": 512 |
| }, |
| { |
| "epoch": 6.496815286624204, |
| "grad_norm": 0.758468508720398, |
| "learning_rate": 2.0316093543323757e-06, |
| "loss": 0.9241, |
| "mean_token_accuracy": 0.7589289247989655, |
| "num_tokens": 27259183.0, |
| "step": 513 |
| }, |
| { |
| "epoch": 6.509554140127388, |
| "grad_norm": 0.7331240773200989, |
| "learning_rate": 1.914237525875917e-06, |
| "loss": 0.9083, |
| "mean_token_accuracy": 0.7633899450302124, |
| "num_tokens": 27315637.0, |
| "step": 514 |
| }, |
| { |
| "epoch": 6.522292993630574, |
| "grad_norm": 0.7536838054656982, |
| "learning_rate": 1.8003250362147005e-06, |
| "loss": 0.8289, |
| "mean_token_accuracy": 0.7863086462020874, |
| "num_tokens": 27363581.0, |
| "step": 515 |
| }, |
| { |
| "epoch": 6.535031847133758, |
| "grad_norm": 0.7688658237457275, |
| "learning_rate": 1.6898759028726285e-06, |
| "loss": 0.9068, |
| "mean_token_accuracy": 0.7663577497005463, |
| "num_tokens": 27414563.0, |
| "step": 516 |
| }, |
| { |
| "epoch": 6.547770700636943, |
| "grad_norm": 0.7456837892532349, |
| "learning_rate": 1.5828940212261889e-06, |
| "loss": 0.9489, |
| "mean_token_accuracy": 0.7578501403331757, |
| "num_tokens": 27468282.0, |
| "step": 517 |
| }, |
| { |
| "epoch": 6.560509554140127, |
| "grad_norm": 0.7611333727836609, |
| "learning_rate": 1.479383164367043e-06, |
| "loss": 0.9226, |
| "mean_token_accuracy": 0.7618197500705719, |
| "num_tokens": 27521855.0, |
| "step": 518 |
| }, |
| { |
| "epoch": 6.573248407643312, |
| "grad_norm": 0.7308273911476135, |
| "learning_rate": 1.3793469829689987e-06, |
| "loss": 0.869, |
| "mean_token_accuracy": 0.7722784578800201, |
| "num_tokens": 27573254.0, |
| "step": 519 |
| }, |
| { |
| "epoch": 6.585987261146497, |
| "grad_norm": 0.7272342443466187, |
| "learning_rate": 1.2827890051592128e-06, |
| "loss": 0.9277, |
| "mean_token_accuracy": 0.7642932236194611, |
| "num_tokens": 27626306.0, |
| "step": 520 |
| }, |
| { |
| "epoch": 6.598726114649682, |
| "grad_norm": 0.7377881407737732, |
| "learning_rate": 1.1897126363937804e-06, |
| "loss": 0.9001, |
| "mean_token_accuracy": 0.7653520107269287, |
| "num_tokens": 27679236.0, |
| "step": 521 |
| }, |
| { |
| "epoch": 6.611464968152866, |
| "grad_norm": 0.7138490676879883, |
| "learning_rate": 1.1001211593376526e-06, |
| "loss": 0.9717, |
| "mean_token_accuracy": 0.7485788762569427, |
| "num_tokens": 27736906.0, |
| "step": 522 |
| }, |
| { |
| "epoch": 6.624203821656051, |
| "grad_norm": 0.7349875569343567, |
| "learning_rate": 1.0140177337488288e-06, |
| "loss": 0.9787, |
| "mean_token_accuracy": 0.748003751039505, |
| "num_tokens": 27791678.0, |
| "step": 523 |
| }, |
| { |
| "epoch": 6.6369426751592355, |
| "grad_norm": 0.7070578932762146, |
| "learning_rate": 9.314053963669245e-07, |
| "loss": 0.8897, |
| "mean_token_accuracy": 0.7702184617519379, |
| "num_tokens": 27848075.0, |
| "step": 524 |
| }, |
| { |
| "epoch": 6.649681528662421, |
| "grad_norm": 0.7422825694084167, |
| "learning_rate": 8.522870608060563e-07, |
| "loss": 0.9565, |
| "mean_token_accuracy": 0.7540837526321411, |
| "num_tokens": 27902710.0, |
| "step": 525 |
| }, |
| { |
| "epoch": 6.662420382165605, |
| "grad_norm": 0.730220377445221, |
| "learning_rate": 7.766655174521465e-07, |
| "loss": 1.0155, |
| "mean_token_accuracy": 0.7437026798725128, |
| "num_tokens": 27957500.0, |
| "step": 526 |
| }, |
| { |
| "epoch": 6.67515923566879, |
| "grad_norm": 0.7156116366386414, |
| "learning_rate": 7.045434333643797e-07, |
| "loss": 0.8918, |
| "mean_token_accuracy": 0.7693358361721039, |
| "num_tokens": 28010748.0, |
| "step": 527 |
| }, |
| { |
| "epoch": 6.687898089171974, |
| "grad_norm": 0.7323397397994995, |
| "learning_rate": 6.359233521813224e-07, |
| "loss": 0.9435, |
| "mean_token_accuracy": 0.7566266059875488, |
| "num_tokens": 28064640.0, |
| "step": 528 |
| }, |
| { |
| "epoch": 6.7006369426751595, |
| "grad_norm": 0.726648211479187, |
| "learning_rate": 5.70807694031028e-07, |
| "loss": 0.9328, |
| "mean_token_accuracy": 0.7591494917869568, |
| "num_tokens": 28117822.0, |
| "step": 529 |
| }, |
| { |
| "epoch": 6.713375796178344, |
| "grad_norm": 0.7227804064750671, |
| "learning_rate": 5.091987554458388e-07, |
| "loss": 0.9072, |
| "mean_token_accuracy": 0.7651616930961609, |
| "num_tokens": 28171144.0, |
| "step": 530 |
| }, |
| { |
| "epoch": 6.726114649681529, |
| "grad_norm": 0.7124402523040771, |
| "learning_rate": 4.510987092812502e-07, |
| "loss": 0.9306, |
| "mean_token_accuracy": 0.7630573511123657, |
| "num_tokens": 28226940.0, |
| "step": 531 |
| }, |
| { |
| "epoch": 6.738853503184713, |
| "grad_norm": 0.7292929291725159, |
| "learning_rate": 3.965096046394057e-07, |
| "loss": 0.9498, |
| "mean_token_accuracy": 0.7523236572742462, |
| "num_tokens": 28280454.0, |
| "step": 532 |
| }, |
| { |
| "epoch": 6.751592356687898, |
| "grad_norm": 0.727213442325592, |
| "learning_rate": 3.4543336679673245e-07, |
| "loss": 0.9254, |
| "mean_token_accuracy": 0.7609288394451141, |
| "num_tokens": 28333652.0, |
| "step": 533 |
| }, |
| { |
| "epoch": 6.764331210191083, |
| "grad_norm": 0.7489280700683594, |
| "learning_rate": 2.978717971360956e-07, |
| "loss": 0.9043, |
| "mean_token_accuracy": 0.7611273527145386, |
| "num_tokens": 28386449.0, |
| "step": 534 |
| }, |
| { |
| "epoch": 6.777070063694268, |
| "grad_norm": 0.7415534853935242, |
| "learning_rate": 2.5382657308322676e-07, |
| "loss": 0.95, |
| "mean_token_accuracy": 0.7531686425209045, |
| "num_tokens": 28441114.0, |
| "step": 535 |
| }, |
| { |
| "epoch": 6.789808917197452, |
| "grad_norm": 0.7236829996109009, |
| "learning_rate": 2.1329924804760482e-07, |
| "loss": 0.9313, |
| "mean_token_accuracy": 0.7573466897010803, |
| "num_tokens": 28495316.0, |
| "step": 536 |
| }, |
| { |
| "epoch": 6.802547770700637, |
| "grad_norm": 0.7350640892982483, |
| "learning_rate": 1.7629125136764402e-07, |
| "loss": 0.916, |
| "mean_token_accuracy": 0.7613226473331451, |
| "num_tokens": 28548205.0, |
| "step": 537 |
| }, |
| { |
| "epoch": 6.8152866242038215, |
| "grad_norm": 0.7304351925849915, |
| "learning_rate": 1.4280388826026782e-07, |
| "loss": 0.9143, |
| "mean_token_accuracy": 0.7636158764362335, |
| "num_tokens": 28601790.0, |
| "step": 538 |
| }, |
| { |
| "epoch": 6.828025477707007, |
| "grad_norm": 0.7234811782836914, |
| "learning_rate": 1.128383397749233e-07, |
| "loss": 0.9575, |
| "mean_token_accuracy": 0.7551866471767426, |
| "num_tokens": 28659230.0, |
| "step": 539 |
| }, |
| { |
| "epoch": 6.840764331210191, |
| "grad_norm": 0.7419787645339966, |
| "learning_rate": 8.639566275189248e-08, |
| "loss": 0.9157, |
| "mean_token_accuracy": 0.7586352527141571, |
| "num_tokens": 28711026.0, |
| "step": 540 |
| }, |
| { |
| "epoch": 6.853503184713376, |
| "grad_norm": 0.7123546600341797, |
| "learning_rate": 6.347678978501082e-08, |
| "loss": 0.8872, |
| "mean_token_accuracy": 0.7726410031318665, |
| "num_tokens": 28765739.0, |
| "step": 541 |
| }, |
| { |
| "epoch": 6.86624203821656, |
| "grad_norm": 0.713035523891449, |
| "learning_rate": 4.408252918880473e-08, |
| "loss": 0.8992, |
| "mean_token_accuracy": 0.7651358842849731, |
| "num_tokens": 28821630.0, |
| "step": 542 |
| }, |
| { |
| "epoch": 6.8789808917197455, |
| "grad_norm": 0.7332026958465576, |
| "learning_rate": 2.8213564969969963e-08, |
| "loss": 0.9474, |
| "mean_token_accuracy": 0.7548873424530029, |
| "num_tokens": 28875172.0, |
| "step": 543 |
| }, |
| { |
| "epoch": 6.89171974522293, |
| "grad_norm": 0.6980507969856262, |
| "learning_rate": 1.5870456803246392e-08, |
| "loss": 0.8873, |
| "mean_token_accuracy": 0.7682437002658844, |
| "num_tokens": 28930288.0, |
| "step": 544 |
| }, |
| { |
| "epoch": 6.904458598726115, |
| "grad_norm": 0.7101753354072571, |
| "learning_rate": 7.053640011678297e-09, |
| "loss": 0.8794, |
| "mean_token_accuracy": 0.770586758852005, |
| "num_tokens": 28985767.0, |
| "step": 545 |
| }, |
| { |
| "epoch": 6.917197452229299, |
| "grad_norm": 0.7474488615989685, |
| "learning_rate": 1.7634255512710695e-09, |
| "loss": 0.9525, |
| "mean_token_accuracy": 0.7564700543880463, |
| "num_tokens": 29037462.0, |
| "step": 546 |
| }, |
| { |
| "epoch": 6.917197452229299, |
| "step": 546, |
| "total_flos": 1.6379330686038835e+18, |
| "train_loss": 1.6175817059073256, |
| "train_runtime": 3399.6626, |
| "train_samples_per_second": 10.295, |
| "train_steps_per_second": 0.161 |
| } |
| ], |
| "logging_steps": 1.0, |
| "max_steps": 546, |
| "num_input_tokens_seen": 0, |
| "num_train_epochs": 7, |
| "save_steps": 100, |
| "stateful_callbacks": { |
| "TrainerControl": { |
| "args": { |
| "should_epoch_stop": false, |
| "should_evaluate": false, |
| "should_log": false, |
| "should_save": true, |
| "should_training_stop": true |
| }, |
| "attributes": {} |
| } |
| }, |
| "total_flos": 1.6379330686038835e+18, |
| "train_batch_size": 8, |
| "trial_name": null, |
| "trial_params": null |
| } |
|
|