{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 2.9013539651837523, "eval_steps": 500, "global_step": 4500, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "entropy": 0.8446818041801453, "epoch": 0.032237266279819474, "grad_norm": 0.2941240072250366, "learning_rate": 0.00019789383193638514, "loss": 0.8516548919677734, "mean_token_accuracy": 0.8109714418649674, "num_tokens": 340552.0, "step": 50 }, { "entropy": 0.5307252839207649, "epoch": 0.06447453255963895, "grad_norm": 0.38026192784309387, "learning_rate": 0.00019574468085106384, "loss": 0.5257245635986328, "mean_token_accuracy": 0.8670955944061279, "num_tokens": 674854.0, "step": 100 }, { "entropy": 0.5256640672683716, "epoch": 0.09671179883945841, "grad_norm": 0.2988957464694977, "learning_rate": 0.00019359552976574252, "loss": 0.5231669235229492, "mean_token_accuracy": 0.8671206516027451, "num_tokens": 1012372.0, "step": 150 }, { "entropy": 0.5012166395783424, "epoch": 0.1289490651192779, "grad_norm": 0.3097330629825592, "learning_rate": 0.00019144637868042123, "loss": 0.4980791473388672, "mean_token_accuracy": 0.8712651997804641, "num_tokens": 1350844.0, "step": 200 }, { "entropy": 0.5085235154628753, "epoch": 0.16118633139909735, "grad_norm": 0.2942444682121277, "learning_rate": 0.00018929722759509994, "loss": 0.5036932754516602, "mean_token_accuracy": 0.8704744702577591, "num_tokens": 1685361.0, "step": 250 }, { "entropy": 0.5039347299933433, "epoch": 0.19342359767891681, "grad_norm": 0.24725373089313507, "learning_rate": 0.00018714807650977865, "loss": 0.5022884368896484, "mean_token_accuracy": 0.8695387196540832, "num_tokens": 2023958.0, "step": 300 }, { "entropy": 0.4997942888736725, "epoch": 0.2256608639587363, "grad_norm": 0.2513591945171356, "learning_rate": 0.00018499892542445735, "loss": 0.4963418579101562, "mean_token_accuracy": 0.8721420967578888, "num_tokens": 2359735.0, "step": 350 }, { "entropy": 0.48731821626424787, "epoch": 0.2578981302385558, "grad_norm": 0.25179457664489746, "learning_rate": 0.00018284977433913606, "loss": 0.4849808502197266, "mean_token_accuracy": 0.8741975021362305, "num_tokens": 2693668.0, "step": 400 }, { "entropy": 0.5134793591499328, "epoch": 0.2901353965183752, "grad_norm": 0.2822740077972412, "learning_rate": 0.00018070062325381477, "loss": 0.5107257461547852, "mean_token_accuracy": 0.8679203641414642, "num_tokens": 3037692.0, "step": 450 }, { "entropy": 0.4719977578520775, "epoch": 0.3223726627981947, "grad_norm": 0.26850372552871704, "learning_rate": 0.00017855147216849345, "loss": 0.46767356872558596, "mean_token_accuracy": 0.8772921580076217, "num_tokens": 3367260.0, "step": 500 }, { "entropy": 0.4927705615758896, "epoch": 0.3546099290780142, "grad_norm": 0.3286154568195343, "learning_rate": 0.00017640232108317216, "loss": 0.48913902282714844, "mean_token_accuracy": 0.8731313848495483, "num_tokens": 3705085.0, "step": 550 }, { "entropy": 0.49470906257629393, "epoch": 0.38684719535783363, "grad_norm": 0.274051696062088, "learning_rate": 0.00017425316999785087, "loss": 0.49117244720458986, "mean_token_accuracy": 0.8720099472999573, "num_tokens": 4047830.0, "step": 600 }, { "entropy": 0.5057245761156082, "epoch": 0.4190844616376531, "grad_norm": 0.3144587278366089, "learning_rate": 0.00017210401891252957, "loss": 0.5029543304443359, "mean_token_accuracy": 0.8694538015127182, "num_tokens": 4393280.0, "step": 650 }, { "entropy": 0.4992050299048424, "epoch": 0.4513217279174726, "grad_norm": 0.2692390978336334, "learning_rate": 0.00016995486782720825, "loss": 0.4958369445800781, "mean_token_accuracy": 0.8719016635417938, "num_tokens": 4734367.0, "step": 700 }, { "entropy": 0.4910887134075165, "epoch": 0.4835589941972921, "grad_norm": 0.23271654546260834, "learning_rate": 0.00016780571674188696, "loss": 0.48952770233154297, "mean_token_accuracy": 0.8705353289842606, "num_tokens": 5077089.0, "step": 750 }, { "entropy": 0.4752439457178116, "epoch": 0.5157962604771116, "grad_norm": 0.22721055150032043, "learning_rate": 0.00016565656565656567, "loss": 0.47227016448974607, "mean_token_accuracy": 0.8776289612054825, "num_tokens": 5417702.0, "step": 800 }, { "entropy": 0.47260456770658493, "epoch": 0.5480335267569311, "grad_norm": 0.24809850752353668, "learning_rate": 0.00016350741457124438, "loss": 0.4697586441040039, "mean_token_accuracy": 0.8765520536899567, "num_tokens": 5757041.0, "step": 850 }, { "entropy": 0.46995863765478135, "epoch": 0.5802707930367504, "grad_norm": 0.2558928430080414, "learning_rate": 0.00016135826348592306, "loss": 0.4632004928588867, "mean_token_accuracy": 0.8774441802501678, "num_tokens": 6090774.0, "step": 900 }, { "entropy": 0.4779966202378273, "epoch": 0.6125080593165699, "grad_norm": 0.25883734226226807, "learning_rate": 0.00015920911240060177, "loss": 0.4720086669921875, "mean_token_accuracy": 0.875939337015152, "num_tokens": 6429650.0, "step": 950 }, { "entropy": 0.4781654465198517, "epoch": 0.6447453255963894, "grad_norm": 0.2638959288597107, "learning_rate": 0.00015705996131528047, "loss": 0.47270626068115235, "mean_token_accuracy": 0.8754388135671616, "num_tokens": 6768597.0, "step": 1000 }, { "entropy": 0.47966611981391905, "epoch": 0.6769825918762089, "grad_norm": 0.26262563467025757, "learning_rate": 0.00015491081022995918, "loss": 0.4755671310424805, "mean_token_accuracy": 0.8750456595420837, "num_tokens": 7105759.0, "step": 1050 }, { "entropy": 0.4859159654378891, "epoch": 0.7092198581560284, "grad_norm": 0.24884097278118134, "learning_rate": 0.00015276165914463786, "loss": 0.48099254608154296, "mean_token_accuracy": 0.8744349056482315, "num_tokens": 7445804.0, "step": 1100 }, { "entropy": 0.47413830548524855, "epoch": 0.7414571244358479, "grad_norm": 0.2644164264202118, "learning_rate": 0.00015061250805931657, "loss": 0.4699359893798828, "mean_token_accuracy": 0.8759887504577637, "num_tokens": 7785856.0, "step": 1150 }, { "entropy": 0.47249517500400545, "epoch": 0.7736943907156673, "grad_norm": 0.2909834384918213, "learning_rate": 0.00014846335697399528, "loss": 0.46724155426025393, "mean_token_accuracy": 0.8777646362781525, "num_tokens": 8121494.0, "step": 1200 }, { "entropy": 0.4700292366743088, "epoch": 0.8059316569954867, "grad_norm": 0.24739807844161987, "learning_rate": 0.00014631420588867398, "loss": 0.46308193206787107, "mean_token_accuracy": 0.8784116441011429, "num_tokens": 8456396.0, "step": 1250 }, { "entropy": 0.4757600948214531, "epoch": 0.8381689232753062, "grad_norm": 0.2676313817501068, "learning_rate": 0.00014416505480335266, "loss": 0.4695530700683594, "mean_token_accuracy": 0.8768039846420288, "num_tokens": 8797056.0, "step": 1300 }, { "entropy": 0.4766714322566986, "epoch": 0.8704061895551257, "grad_norm": 0.2617861330509186, "learning_rate": 0.00014201590371803137, "loss": 0.47455707550048826, "mean_token_accuracy": 0.8762617337703705, "num_tokens": 9134060.0, "step": 1350 }, { "entropy": 0.4656816709041596, "epoch": 0.9026434558349452, "grad_norm": 0.2809736132621765, "learning_rate": 0.0001398667526327101, "loss": 0.4575202941894531, "mean_token_accuracy": 0.8793036764860154, "num_tokens": 9466192.0, "step": 1400 }, { "entropy": 0.47205123156309126, "epoch": 0.9348807221147647, "grad_norm": 0.27606886625289917, "learning_rate": 0.0001377176015473888, "loss": 0.465732307434082, "mean_token_accuracy": 0.8769072258472442, "num_tokens": 9806711.0, "step": 1450 }, { "entropy": 0.47290341585874557, "epoch": 0.9671179883945842, "grad_norm": 0.2559572160243988, "learning_rate": 0.0001355684504620675, "loss": 0.46756675720214846, "mean_token_accuracy": 0.8773910355567932, "num_tokens": 10142536.0, "step": 1500 }, { "entropy": 0.4555113708972931, "epoch": 0.9993552546744036, "grad_norm": 0.24697217345237732, "learning_rate": 0.0001334192993767462, "loss": 0.4486907958984375, "mean_token_accuracy": 0.8813155192136765, "num_tokens": 10474177.0, "step": 1550 }, { "entropy": 0.46760996848344805, "epoch": 1.0315925209542232, "grad_norm": 0.2382114678621292, "learning_rate": 0.0001312701482914249, "loss": 0.459778938293457, "mean_token_accuracy": 0.8778466558456421, "num_tokens": 10814205.0, "step": 1600 }, { "entropy": 0.477926442027092, "epoch": 1.0638297872340425, "grad_norm": 0.2497527152299881, "learning_rate": 0.0001291209972061036, "loss": 0.4692169189453125, "mean_token_accuracy": 0.8761335426568985, "num_tokens": 11158647.0, "step": 1650 }, { "entropy": 0.4668825376033783, "epoch": 1.096067053513862, "grad_norm": 0.3097824156284332, "learning_rate": 0.0001269718461207823, "loss": 0.4580715560913086, "mean_token_accuracy": 0.8783014410734177, "num_tokens": 11503048.0, "step": 1700 }, { "entropy": 0.4613112932443619, "epoch": 1.1283043197936815, "grad_norm": 0.28493526577949524, "learning_rate": 0.000124822695035461, "loss": 0.4552203369140625, "mean_token_accuracy": 0.8796335273981094, "num_tokens": 11842333.0, "step": 1750 }, { "entropy": 0.45046652257442477, "epoch": 1.1605415860735009, "grad_norm": 0.28386086225509644, "learning_rate": 0.00012267354395013971, "loss": 0.44170757293701174, "mean_token_accuracy": 0.8831979554891586, "num_tokens": 12178505.0, "step": 1800 }, { "entropy": 0.452339848279953, "epoch": 1.1927788523533205, "grad_norm": 0.3006383776664734, "learning_rate": 0.00012052439286481841, "loss": 0.44465755462646483, "mean_token_accuracy": 0.88213940680027, "num_tokens": 12516910.0, "step": 1850 }, { "entropy": 0.4495898771286011, "epoch": 1.2250161186331399, "grad_norm": 0.257289856672287, "learning_rate": 0.0001183752417794971, "loss": 0.4418718719482422, "mean_token_accuracy": 0.8825601398944855, "num_tokens": 12855332.0, "step": 1900 }, { "entropy": 0.46036251038312914, "epoch": 1.2572533849129595, "grad_norm": 0.2901777923107147, "learning_rate": 0.00011622609069417581, "loss": 0.45159675598144533, "mean_token_accuracy": 0.8801065158843994, "num_tokens": 13194738.0, "step": 1950 }, { "entropy": 0.4662597167491913, "epoch": 1.2894906511927788, "grad_norm": 0.3183293044567108, "learning_rate": 0.0001140769396088545, "loss": 0.458433837890625, "mean_token_accuracy": 0.8789826226234436, "num_tokens": 13534537.0, "step": 2000 }, { "entropy": 0.470826989710331, "epoch": 1.3217279174725984, "grad_norm": 0.26847565174102783, "learning_rate": 0.00011192778852353321, "loss": 0.461640510559082, "mean_token_accuracy": 0.8773523569107056, "num_tokens": 13876529.0, "step": 2050 }, { "entropy": 0.4441897264122963, "epoch": 1.3539651837524178, "grad_norm": 0.24220123887062073, "learning_rate": 0.0001097786374382119, "loss": 0.4363685989379883, "mean_token_accuracy": 0.8843007552623748, "num_tokens": 14208999.0, "step": 2100 }, { "entropy": 0.46262448877096174, "epoch": 1.3862024500322372, "grad_norm": 0.29929131269454956, "learning_rate": 0.0001076294863528906, "loss": 0.4530683135986328, "mean_token_accuracy": 0.8798254084587097, "num_tokens": 14547532.0, "step": 2150 }, { "entropy": 0.45200063675642016, "epoch": 1.4184397163120568, "grad_norm": 0.28762561082839966, "learning_rate": 0.00010548033526756931, "loss": 0.44509330749511716, "mean_token_accuracy": 0.8822088545560837, "num_tokens": 14885562.0, "step": 2200 }, { "entropy": 0.46206449300050734, "epoch": 1.4506769825918762, "grad_norm": 0.29035645723342896, "learning_rate": 0.000103331184182248, "loss": 0.45523059844970704, "mean_token_accuracy": 0.879514684677124, "num_tokens": 15224693.0, "step": 2250 }, { "entropy": 0.4511671251058578, "epoch": 1.4829142488716958, "grad_norm": 0.3083575963973999, "learning_rate": 0.00010118203309692671, "loss": 0.4417449569702148, "mean_token_accuracy": 0.8826043558120727, "num_tokens": 15564153.0, "step": 2300 }, { "entropy": 0.4486639258265495, "epoch": 1.5151515151515151, "grad_norm": 0.2648044228553772, "learning_rate": 9.903288201160542e-05, "loss": 0.44109046936035157, "mean_token_accuracy": 0.8820929783582687, "num_tokens": 15897751.0, "step": 2350 }, { "entropy": 0.44873525500297545, "epoch": 1.5473887814313345, "grad_norm": 0.31508272886276245, "learning_rate": 9.688373092628413e-05, "loss": 0.4406051254272461, "mean_token_accuracy": 0.8828574746847153, "num_tokens": 16235250.0, "step": 2400 }, { "entropy": 0.45740653783082963, "epoch": 1.5796260477111541, "grad_norm": 0.31200388073921204, "learning_rate": 9.473457984096282e-05, "loss": 0.4479224395751953, "mean_token_accuracy": 0.881089192032814, "num_tokens": 16572988.0, "step": 2450 }, { "entropy": 0.44977363795042036, "epoch": 1.6118633139909737, "grad_norm": 0.30033040046691895, "learning_rate": 9.258542875564153e-05, "loss": 0.4417670059204102, "mean_token_accuracy": 0.8823639768362045, "num_tokens": 16910477.0, "step": 2500 }, { "entropy": 0.45035569489002225, "epoch": 1.644100580270793, "grad_norm": 0.2903454005718231, "learning_rate": 9.043627767032022e-05, "loss": 0.44128196716308593, "mean_token_accuracy": 0.8826896560192108, "num_tokens": 17250232.0, "step": 2550 }, { "entropy": 0.4546844300627708, "epoch": 1.6763378465506125, "grad_norm": 0.31954842805862427, "learning_rate": 8.828712658499893e-05, "loss": 0.44637454986572267, "mean_token_accuracy": 0.8815962445735931, "num_tokens": 17588504.0, "step": 2600 }, { "entropy": 0.4702127456665039, "epoch": 1.7085751128304318, "grad_norm": 0.2877423167228699, "learning_rate": 8.613797549967764e-05, "loss": 0.46254016876220705, "mean_token_accuracy": 0.8771249955892563, "num_tokens": 17933060.0, "step": 2650 }, { "entropy": 0.4469280856847763, "epoch": 1.7408123791102514, "grad_norm": 0.2817021906375885, "learning_rate": 8.398882441435633e-05, "loss": 0.43881519317626955, "mean_token_accuracy": 0.8837608104944229, "num_tokens": 18266535.0, "step": 2700 }, { "entropy": 0.455581805408001, "epoch": 1.773049645390071, "grad_norm": 0.31535229086875916, "learning_rate": 8.183967332903504e-05, "loss": 0.44726665496826173, "mean_token_accuracy": 0.8812869715690613, "num_tokens": 18603326.0, "step": 2750 }, { "entropy": 0.43902623891830445, "epoch": 1.8052869116698904, "grad_norm": 0.2788417339324951, "learning_rate": 7.969052224371373e-05, "loss": 0.42899021148681643, "mean_token_accuracy": 0.8851540559530258, "num_tokens": 18939700.0, "step": 2800 }, { "entropy": 0.45259665727615356, "epoch": 1.8375241779497098, "grad_norm": 0.27750885486602783, "learning_rate": 7.754137115839244e-05, "loss": 0.4436537551879883, "mean_token_accuracy": 0.8825727927684784, "num_tokens": 19275565.0, "step": 2850 }, { "entropy": 0.43768042981624605, "epoch": 1.8697614442295294, "grad_norm": 0.30853450298309326, "learning_rate": 7.539222007307113e-05, "loss": 0.4311842346191406, "mean_token_accuracy": 0.8850624537467957, "num_tokens": 19607809.0, "step": 2900 }, { "entropy": 0.44810337752103807, "epoch": 1.9019987105093488, "grad_norm": 0.32159748673439026, "learning_rate": 7.324306898774984e-05, "loss": 0.4413007736206055, "mean_token_accuracy": 0.8821072828769684, "num_tokens": 19941679.0, "step": 2950 }, { "entropy": 0.4376507529616356, "epoch": 1.9342359767891684, "grad_norm": 0.28715935349464417, "learning_rate": 7.109391790242854e-05, "loss": 0.4271116256713867, "mean_token_accuracy": 0.8850878685712814, "num_tokens": 20276932.0, "step": 3000 }, { "entropy": 0.44526120245456696, "epoch": 1.9664732430689877, "grad_norm": 0.2948083281517029, "learning_rate": 6.894476681710724e-05, "loss": 0.43935283660888674, "mean_token_accuracy": 0.8832118940353394, "num_tokens": 20613740.0, "step": 3050 }, { "entropy": 0.44097375571727754, "epoch": 1.9987105093488071, "grad_norm": 0.28070375323295593, "learning_rate": 6.679561573178594e-05, "loss": 0.43161014556884764, "mean_token_accuracy": 0.8843864989280701, "num_tokens": 20948040.0, "step": 3100 }, { "entropy": 0.4366187188029289, "epoch": 2.0309477756286265, "grad_norm": 0.2711784243583679, "learning_rate": 6.464646464646466e-05, "loss": 0.4246902084350586, "mean_token_accuracy": 0.8861147791147232, "num_tokens": 21284152.0, "step": 3150 }, { "entropy": 0.4292546170949936, "epoch": 2.0631850419084463, "grad_norm": 0.3474438488483429, "learning_rate": 6.249731356114335e-05, "loss": 0.41976234436035154, "mean_token_accuracy": 0.8869011825323105, "num_tokens": 21623591.0, "step": 3200 }, { "entropy": 0.4441410732269287, "epoch": 2.0954223081882657, "grad_norm": 0.27009403705596924, "learning_rate": 6.0348162475822054e-05, "loss": 0.4335956192016602, "mean_token_accuracy": 0.8844973957538604, "num_tokens": 21961239.0, "step": 3250 }, { "entropy": 0.4423326799273491, "epoch": 2.127659574468085, "grad_norm": 0.31351885199546814, "learning_rate": 5.8199011390500755e-05, "loss": 0.43222076416015626, "mean_token_accuracy": 0.8844653475284576, "num_tokens": 22297355.0, "step": 3300 }, { "entropy": 0.43579984217882156, "epoch": 2.1598968407479044, "grad_norm": 0.3104802072048187, "learning_rate": 5.6049860305179456e-05, "loss": 0.42580715179443357, "mean_token_accuracy": 0.8859012949466706, "num_tokens": 22636061.0, "step": 3350 }, { "entropy": 0.4307232940196991, "epoch": 2.192134107027724, "grad_norm": 0.30051860213279724, "learning_rate": 5.390070921985816e-05, "loss": 0.41833953857421874, "mean_token_accuracy": 0.886508920788765, "num_tokens": 22975583.0, "step": 3400 }, { "entropy": 0.43692171543836594, "epoch": 2.2243713733075436, "grad_norm": 0.3109855353832245, "learning_rate": 5.175155813453686e-05, "loss": 0.4261277389526367, "mean_token_accuracy": 0.8851550126075745, "num_tokens": 23316198.0, "step": 3450 }, { "entropy": 0.42780830681324006, "epoch": 2.256608639587363, "grad_norm": 0.3165053725242615, "learning_rate": 4.960240704921556e-05, "loss": 0.41836185455322267, "mean_token_accuracy": 0.8882633966207504, "num_tokens": 23654932.0, "step": 3500 }, { "entropy": 0.4399165993928909, "epoch": 2.2888459058671824, "grad_norm": 0.31702736020088196, "learning_rate": 4.745325596389427e-05, "loss": 0.42992683410644533, "mean_token_accuracy": 0.884578087925911, "num_tokens": 23994334.0, "step": 3550 }, { "entropy": 0.44941207855939863, "epoch": 2.3210831721470018, "grad_norm": 0.382436066865921, "learning_rate": 4.530410487857297e-05, "loss": 0.43822154998779295, "mean_token_accuracy": 0.8836333215236664, "num_tokens": 24334916.0, "step": 3600 }, { "entropy": 0.43192073941230774, "epoch": 2.3533204384268216, "grad_norm": 0.34604012966156006, "learning_rate": 4.315495379325167e-05, "loss": 0.42123512268066404, "mean_token_accuracy": 0.8872571766376496, "num_tokens": 24671467.0, "step": 3650 }, { "entropy": 0.44117815017700196, "epoch": 2.385557704706641, "grad_norm": 0.31164106726646423, "learning_rate": 4.100580270793037e-05, "loss": 0.4305222702026367, "mean_token_accuracy": 0.8850024062395095, "num_tokens": 25007960.0, "step": 3700 }, { "entropy": 0.42460927098989487, "epoch": 2.4177949709864603, "grad_norm": 0.31209173798561096, "learning_rate": 3.885665162260907e-05, "loss": 0.41318531036376954, "mean_token_accuracy": 0.8890041667222977, "num_tokens": 25338303.0, "step": 3750 }, { "entropy": 0.4464882066845894, "epoch": 2.4500322372662797, "grad_norm": 0.330119252204895, "learning_rate": 3.670750053728778e-05, "loss": 0.4390181350708008, "mean_token_accuracy": 0.8836234956979752, "num_tokens": 25682388.0, "step": 3800 }, { "entropy": 0.4420609429478645, "epoch": 2.482269503546099, "grad_norm": 0.3061470687389374, "learning_rate": 3.455834945196648e-05, "loss": 0.4278445053100586, "mean_token_accuracy": 0.8854056459665298, "num_tokens": 26024136.0, "step": 3850 }, { "entropy": 0.4190295284986496, "epoch": 2.514506769825919, "grad_norm": 0.32077500224113464, "learning_rate": 3.240919836664518e-05, "loss": 0.41114852905273436, "mean_token_accuracy": 0.8895813000202178, "num_tokens": 26363036.0, "step": 3900 }, { "entropy": 0.4384055981040001, "epoch": 2.5467440361057383, "grad_norm": 0.3177681863307953, "learning_rate": 3.0260047281323877e-05, "loss": 0.4273562240600586, "mean_token_accuracy": 0.8855825281143188, "num_tokens": 26701951.0, "step": 3950 }, { "entropy": 0.43118291586637497, "epoch": 2.5789813023855577, "grad_norm": 0.29330846667289734, "learning_rate": 2.8110896196002578e-05, "loss": 0.41927295684814453, "mean_token_accuracy": 0.8882288312911988, "num_tokens": 27039067.0, "step": 4000 }, { "entropy": 0.43496464341878893, "epoch": 2.611218568665377, "grad_norm": 0.31839463114738464, "learning_rate": 2.5961745110681286e-05, "loss": 0.4239920425415039, "mean_token_accuracy": 0.886286124587059, "num_tokens": 27373718.0, "step": 4050 }, { "entropy": 0.43482948303222657, "epoch": 2.643455834945197, "grad_norm": 0.30345892906188965, "learning_rate": 2.3812594025359983e-05, "loss": 0.42235206604003905, "mean_token_accuracy": 0.8865206915140152, "num_tokens": 27708238.0, "step": 4100 }, { "entropy": 0.4274810257554054, "epoch": 2.6756931012250162, "grad_norm": 0.3029744029045105, "learning_rate": 2.1663442940038688e-05, "loss": 0.41650020599365234, "mean_token_accuracy": 0.8881079655885696, "num_tokens": 28041964.0, "step": 4150 }, { "entropy": 0.43494893968105314, "epoch": 2.7079303675048356, "grad_norm": 0.31539738178253174, "learning_rate": 1.951429185471739e-05, "loss": 0.4245531463623047, "mean_token_accuracy": 0.8865839475393296, "num_tokens": 28378719.0, "step": 4200 }, { "entropy": 0.4375846874713898, "epoch": 2.740167633784655, "grad_norm": 0.31120166182518005, "learning_rate": 1.736514076939609e-05, "loss": 0.427888069152832, "mean_token_accuracy": 0.8849086022377014, "num_tokens": 28718819.0, "step": 4250 }, { "entropy": 0.4191849535703659, "epoch": 2.7724049000644744, "grad_norm": 0.3305680751800537, "learning_rate": 1.521598968407479e-05, "loss": 0.4062779998779297, "mean_token_accuracy": 0.8907963120937348, "num_tokens": 29053437.0, "step": 4300 }, { "entropy": 0.44296603530645373, "epoch": 2.804642166344294, "grad_norm": 0.34950941801071167, "learning_rate": 1.3066838598753491e-05, "loss": 0.4340578842163086, "mean_token_accuracy": 0.8846180647611618, "num_tokens": 29389949.0, "step": 4350 }, { "entropy": 0.44456703811883924, "epoch": 2.8368794326241136, "grad_norm": 0.3210543096065521, "learning_rate": 1.0917687513432196e-05, "loss": 0.43384292602539065, "mean_token_accuracy": 0.8840754866600037, "num_tokens": 29728935.0, "step": 4400 }, { "entropy": 0.43473256975412367, "epoch": 2.869116698903933, "grad_norm": 0.3032950162887573, "learning_rate": 8.768536428110897e-06, "loss": 0.4252130126953125, "mean_token_accuracy": 0.8865963506698609, "num_tokens": 30065697.0, "step": 4450 }, { "entropy": 0.43983528643846515, "epoch": 2.9013539651837523, "grad_norm": 0.37149280309677124, "learning_rate": 6.619385342789598e-06, "loss": 0.4294190979003906, "mean_token_accuracy": 0.8858663266897202, "num_tokens": 30401977.0, "step": 4500 } ], "logging_steps": 50, "max_steps": 4653, "num_input_tokens_seen": 0, "num_train_epochs": 3, "save_steps": 500, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 1.224183762523392e+17, "train_batch_size": 16, "trial_name": null, "trial_params": null }