aide-smart-dictation / checkpoint-4500 /trainer_state.json
randomath's picture
Upload folder using huggingface_hub
78b6e41 verified
Raw
History Blame Contribute Delete
28.2 kB
{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 2.9013539651837523,
"eval_steps": 500,
"global_step": 4500,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"entropy": 0.8446818041801453,
"epoch": 0.032237266279819474,
"grad_norm": 0.2941240072250366,
"learning_rate": 0.00019789383193638514,
"loss": 0.8516548919677734,
"mean_token_accuracy": 0.8109714418649674,
"num_tokens": 340552.0,
"step": 50
},
{
"entropy": 0.5307252839207649,
"epoch": 0.06447453255963895,
"grad_norm": 0.38026192784309387,
"learning_rate": 0.00019574468085106384,
"loss": 0.5257245635986328,
"mean_token_accuracy": 0.8670955944061279,
"num_tokens": 674854.0,
"step": 100
},
{
"entropy": 0.5256640672683716,
"epoch": 0.09671179883945841,
"grad_norm": 0.2988957464694977,
"learning_rate": 0.00019359552976574252,
"loss": 0.5231669235229492,
"mean_token_accuracy": 0.8671206516027451,
"num_tokens": 1012372.0,
"step": 150
},
{
"entropy": 0.5012166395783424,
"epoch": 0.1289490651192779,
"grad_norm": 0.3097330629825592,
"learning_rate": 0.00019144637868042123,
"loss": 0.4980791473388672,
"mean_token_accuracy": 0.8712651997804641,
"num_tokens": 1350844.0,
"step": 200
},
{
"entropy": 0.5085235154628753,
"epoch": 0.16118633139909735,
"grad_norm": 0.2942444682121277,
"learning_rate": 0.00018929722759509994,
"loss": 0.5036932754516602,
"mean_token_accuracy": 0.8704744702577591,
"num_tokens": 1685361.0,
"step": 250
},
{
"entropy": 0.5039347299933433,
"epoch": 0.19342359767891681,
"grad_norm": 0.24725373089313507,
"learning_rate": 0.00018714807650977865,
"loss": 0.5022884368896484,
"mean_token_accuracy": 0.8695387196540832,
"num_tokens": 2023958.0,
"step": 300
},
{
"entropy": 0.4997942888736725,
"epoch": 0.2256608639587363,
"grad_norm": 0.2513591945171356,
"learning_rate": 0.00018499892542445735,
"loss": 0.4963418579101562,
"mean_token_accuracy": 0.8721420967578888,
"num_tokens": 2359735.0,
"step": 350
},
{
"entropy": 0.48731821626424787,
"epoch": 0.2578981302385558,
"grad_norm": 0.25179457664489746,
"learning_rate": 0.00018284977433913606,
"loss": 0.4849808502197266,
"mean_token_accuracy": 0.8741975021362305,
"num_tokens": 2693668.0,
"step": 400
},
{
"entropy": 0.5134793591499328,
"epoch": 0.2901353965183752,
"grad_norm": 0.2822740077972412,
"learning_rate": 0.00018070062325381477,
"loss": 0.5107257461547852,
"mean_token_accuracy": 0.8679203641414642,
"num_tokens": 3037692.0,
"step": 450
},
{
"entropy": 0.4719977578520775,
"epoch": 0.3223726627981947,
"grad_norm": 0.26850372552871704,
"learning_rate": 0.00017855147216849345,
"loss": 0.46767356872558596,
"mean_token_accuracy": 0.8772921580076217,
"num_tokens": 3367260.0,
"step": 500
},
{
"entropy": 0.4927705615758896,
"epoch": 0.3546099290780142,
"grad_norm": 0.3286154568195343,
"learning_rate": 0.00017640232108317216,
"loss": 0.48913902282714844,
"mean_token_accuracy": 0.8731313848495483,
"num_tokens": 3705085.0,
"step": 550
},
{
"entropy": 0.49470906257629393,
"epoch": 0.38684719535783363,
"grad_norm": 0.274051696062088,
"learning_rate": 0.00017425316999785087,
"loss": 0.49117244720458986,
"mean_token_accuracy": 0.8720099472999573,
"num_tokens": 4047830.0,
"step": 600
},
{
"entropy": 0.5057245761156082,
"epoch": 0.4190844616376531,
"grad_norm": 0.3144587278366089,
"learning_rate": 0.00017210401891252957,
"loss": 0.5029543304443359,
"mean_token_accuracy": 0.8694538015127182,
"num_tokens": 4393280.0,
"step": 650
},
{
"entropy": 0.4992050299048424,
"epoch": 0.4513217279174726,
"grad_norm": 0.2692390978336334,
"learning_rate": 0.00016995486782720825,
"loss": 0.4958369445800781,
"mean_token_accuracy": 0.8719016635417938,
"num_tokens": 4734367.0,
"step": 700
},
{
"entropy": 0.4910887134075165,
"epoch": 0.4835589941972921,
"grad_norm": 0.23271654546260834,
"learning_rate": 0.00016780571674188696,
"loss": 0.48952770233154297,
"mean_token_accuracy": 0.8705353289842606,
"num_tokens": 5077089.0,
"step": 750
},
{
"entropy": 0.4752439457178116,
"epoch": 0.5157962604771116,
"grad_norm": 0.22721055150032043,
"learning_rate": 0.00016565656565656567,
"loss": 0.47227016448974607,
"mean_token_accuracy": 0.8776289612054825,
"num_tokens": 5417702.0,
"step": 800
},
{
"entropy": 0.47260456770658493,
"epoch": 0.5480335267569311,
"grad_norm": 0.24809850752353668,
"learning_rate": 0.00016350741457124438,
"loss": 0.4697586441040039,
"mean_token_accuracy": 0.8765520536899567,
"num_tokens": 5757041.0,
"step": 850
},
{
"entropy": 0.46995863765478135,
"epoch": 0.5802707930367504,
"grad_norm": 0.2558928430080414,
"learning_rate": 0.00016135826348592306,
"loss": 0.4632004928588867,
"mean_token_accuracy": 0.8774441802501678,
"num_tokens": 6090774.0,
"step": 900
},
{
"entropy": 0.4779966202378273,
"epoch": 0.6125080593165699,
"grad_norm": 0.25883734226226807,
"learning_rate": 0.00015920911240060177,
"loss": 0.4720086669921875,
"mean_token_accuracy": 0.875939337015152,
"num_tokens": 6429650.0,
"step": 950
},
{
"entropy": 0.4781654465198517,
"epoch": 0.6447453255963894,
"grad_norm": 0.2638959288597107,
"learning_rate": 0.00015705996131528047,
"loss": 0.47270626068115235,
"mean_token_accuracy": 0.8754388135671616,
"num_tokens": 6768597.0,
"step": 1000
},
{
"entropy": 0.47966611981391905,
"epoch": 0.6769825918762089,
"grad_norm": 0.26262563467025757,
"learning_rate": 0.00015491081022995918,
"loss": 0.4755671310424805,
"mean_token_accuracy": 0.8750456595420837,
"num_tokens": 7105759.0,
"step": 1050
},
{
"entropy": 0.4859159654378891,
"epoch": 0.7092198581560284,
"grad_norm": 0.24884097278118134,
"learning_rate": 0.00015276165914463786,
"loss": 0.48099254608154296,
"mean_token_accuracy": 0.8744349056482315,
"num_tokens": 7445804.0,
"step": 1100
},
{
"entropy": 0.47413830548524855,
"epoch": 0.7414571244358479,
"grad_norm": 0.2644164264202118,
"learning_rate": 0.00015061250805931657,
"loss": 0.4699359893798828,
"mean_token_accuracy": 0.8759887504577637,
"num_tokens": 7785856.0,
"step": 1150
},
{
"entropy": 0.47249517500400545,
"epoch": 0.7736943907156673,
"grad_norm": 0.2909834384918213,
"learning_rate": 0.00014846335697399528,
"loss": 0.46724155426025393,
"mean_token_accuracy": 0.8777646362781525,
"num_tokens": 8121494.0,
"step": 1200
},
{
"entropy": 0.4700292366743088,
"epoch": 0.8059316569954867,
"grad_norm": 0.24739807844161987,
"learning_rate": 0.00014631420588867398,
"loss": 0.46308193206787107,
"mean_token_accuracy": 0.8784116441011429,
"num_tokens": 8456396.0,
"step": 1250
},
{
"entropy": 0.4757600948214531,
"epoch": 0.8381689232753062,
"grad_norm": 0.2676313817501068,
"learning_rate": 0.00014416505480335266,
"loss": 0.4695530700683594,
"mean_token_accuracy": 0.8768039846420288,
"num_tokens": 8797056.0,
"step": 1300
},
{
"entropy": 0.4766714322566986,
"epoch": 0.8704061895551257,
"grad_norm": 0.2617861330509186,
"learning_rate": 0.00014201590371803137,
"loss": 0.47455707550048826,
"mean_token_accuracy": 0.8762617337703705,
"num_tokens": 9134060.0,
"step": 1350
},
{
"entropy": 0.4656816709041596,
"epoch": 0.9026434558349452,
"grad_norm": 0.2809736132621765,
"learning_rate": 0.0001398667526327101,
"loss": 0.4575202941894531,
"mean_token_accuracy": 0.8793036764860154,
"num_tokens": 9466192.0,
"step": 1400
},
{
"entropy": 0.47205123156309126,
"epoch": 0.9348807221147647,
"grad_norm": 0.27606886625289917,
"learning_rate": 0.0001377176015473888,
"loss": 0.465732307434082,
"mean_token_accuracy": 0.8769072258472442,
"num_tokens": 9806711.0,
"step": 1450
},
{
"entropy": 0.47290341585874557,
"epoch": 0.9671179883945842,
"grad_norm": 0.2559572160243988,
"learning_rate": 0.0001355684504620675,
"loss": 0.46756675720214846,
"mean_token_accuracy": 0.8773910355567932,
"num_tokens": 10142536.0,
"step": 1500
},
{
"entropy": 0.4555113708972931,
"epoch": 0.9993552546744036,
"grad_norm": 0.24697217345237732,
"learning_rate": 0.0001334192993767462,
"loss": 0.4486907958984375,
"mean_token_accuracy": 0.8813155192136765,
"num_tokens": 10474177.0,
"step": 1550
},
{
"entropy": 0.46760996848344805,
"epoch": 1.0315925209542232,
"grad_norm": 0.2382114678621292,
"learning_rate": 0.0001312701482914249,
"loss": 0.459778938293457,
"mean_token_accuracy": 0.8778466558456421,
"num_tokens": 10814205.0,
"step": 1600
},
{
"entropy": 0.477926442027092,
"epoch": 1.0638297872340425,
"grad_norm": 0.2497527152299881,
"learning_rate": 0.0001291209972061036,
"loss": 0.4692169189453125,
"mean_token_accuracy": 0.8761335426568985,
"num_tokens": 11158647.0,
"step": 1650
},
{
"entropy": 0.4668825376033783,
"epoch": 1.096067053513862,
"grad_norm": 0.3097824156284332,
"learning_rate": 0.0001269718461207823,
"loss": 0.4580715560913086,
"mean_token_accuracy": 0.8783014410734177,
"num_tokens": 11503048.0,
"step": 1700
},
{
"entropy": 0.4613112932443619,
"epoch": 1.1283043197936815,
"grad_norm": 0.28493526577949524,
"learning_rate": 0.000124822695035461,
"loss": 0.4552203369140625,
"mean_token_accuracy": 0.8796335273981094,
"num_tokens": 11842333.0,
"step": 1750
},
{
"entropy": 0.45046652257442477,
"epoch": 1.1605415860735009,
"grad_norm": 0.28386086225509644,
"learning_rate": 0.00012267354395013971,
"loss": 0.44170757293701174,
"mean_token_accuracy": 0.8831979554891586,
"num_tokens": 12178505.0,
"step": 1800
},
{
"entropy": 0.452339848279953,
"epoch": 1.1927788523533205,
"grad_norm": 0.3006383776664734,
"learning_rate": 0.00012052439286481841,
"loss": 0.44465755462646483,
"mean_token_accuracy": 0.88213940680027,
"num_tokens": 12516910.0,
"step": 1850
},
{
"entropy": 0.4495898771286011,
"epoch": 1.2250161186331399,
"grad_norm": 0.257289856672287,
"learning_rate": 0.0001183752417794971,
"loss": 0.4418718719482422,
"mean_token_accuracy": 0.8825601398944855,
"num_tokens": 12855332.0,
"step": 1900
},
{
"entropy": 0.46036251038312914,
"epoch": 1.2572533849129595,
"grad_norm": 0.2901777923107147,
"learning_rate": 0.00011622609069417581,
"loss": 0.45159675598144533,
"mean_token_accuracy": 0.8801065158843994,
"num_tokens": 13194738.0,
"step": 1950
},
{
"entropy": 0.4662597167491913,
"epoch": 1.2894906511927788,
"grad_norm": 0.3183293044567108,
"learning_rate": 0.0001140769396088545,
"loss": 0.458433837890625,
"mean_token_accuracy": 0.8789826226234436,
"num_tokens": 13534537.0,
"step": 2000
},
{
"entropy": 0.470826989710331,
"epoch": 1.3217279174725984,
"grad_norm": 0.26847565174102783,
"learning_rate": 0.00011192778852353321,
"loss": 0.461640510559082,
"mean_token_accuracy": 0.8773523569107056,
"num_tokens": 13876529.0,
"step": 2050
},
{
"entropy": 0.4441897264122963,
"epoch": 1.3539651837524178,
"grad_norm": 0.24220123887062073,
"learning_rate": 0.0001097786374382119,
"loss": 0.4363685989379883,
"mean_token_accuracy": 0.8843007552623748,
"num_tokens": 14208999.0,
"step": 2100
},
{
"entropy": 0.46262448877096174,
"epoch": 1.3862024500322372,
"grad_norm": 0.29929131269454956,
"learning_rate": 0.0001076294863528906,
"loss": 0.4530683135986328,
"mean_token_accuracy": 0.8798254084587097,
"num_tokens": 14547532.0,
"step": 2150
},
{
"entropy": 0.45200063675642016,
"epoch": 1.4184397163120568,
"grad_norm": 0.28762561082839966,
"learning_rate": 0.00010548033526756931,
"loss": 0.44509330749511716,
"mean_token_accuracy": 0.8822088545560837,
"num_tokens": 14885562.0,
"step": 2200
},
{
"entropy": 0.46206449300050734,
"epoch": 1.4506769825918762,
"grad_norm": 0.29035645723342896,
"learning_rate": 0.000103331184182248,
"loss": 0.45523059844970704,
"mean_token_accuracy": 0.879514684677124,
"num_tokens": 15224693.0,
"step": 2250
},
{
"entropy": 0.4511671251058578,
"epoch": 1.4829142488716958,
"grad_norm": 0.3083575963973999,
"learning_rate": 0.00010118203309692671,
"loss": 0.4417449569702148,
"mean_token_accuracy": 0.8826043558120727,
"num_tokens": 15564153.0,
"step": 2300
},
{
"entropy": 0.4486639258265495,
"epoch": 1.5151515151515151,
"grad_norm": 0.2648044228553772,
"learning_rate": 9.903288201160542e-05,
"loss": 0.44109046936035157,
"mean_token_accuracy": 0.8820929783582687,
"num_tokens": 15897751.0,
"step": 2350
},
{
"entropy": 0.44873525500297545,
"epoch": 1.5473887814313345,
"grad_norm": 0.31508272886276245,
"learning_rate": 9.688373092628413e-05,
"loss": 0.4406051254272461,
"mean_token_accuracy": 0.8828574746847153,
"num_tokens": 16235250.0,
"step": 2400
},
{
"entropy": 0.45740653783082963,
"epoch": 1.5796260477111541,
"grad_norm": 0.31200388073921204,
"learning_rate": 9.473457984096282e-05,
"loss": 0.4479224395751953,
"mean_token_accuracy": 0.881089192032814,
"num_tokens": 16572988.0,
"step": 2450
},
{
"entropy": 0.44977363795042036,
"epoch": 1.6118633139909737,
"grad_norm": 0.30033040046691895,
"learning_rate": 9.258542875564153e-05,
"loss": 0.4417670059204102,
"mean_token_accuracy": 0.8823639768362045,
"num_tokens": 16910477.0,
"step": 2500
},
{
"entropy": 0.45035569489002225,
"epoch": 1.644100580270793,
"grad_norm": 0.2903454005718231,
"learning_rate": 9.043627767032022e-05,
"loss": 0.44128196716308593,
"mean_token_accuracy": 0.8826896560192108,
"num_tokens": 17250232.0,
"step": 2550
},
{
"entropy": 0.4546844300627708,
"epoch": 1.6763378465506125,
"grad_norm": 0.31954842805862427,
"learning_rate": 8.828712658499893e-05,
"loss": 0.44637454986572267,
"mean_token_accuracy": 0.8815962445735931,
"num_tokens": 17588504.0,
"step": 2600
},
{
"entropy": 0.4702127456665039,
"epoch": 1.7085751128304318,
"grad_norm": 0.2877423167228699,
"learning_rate": 8.613797549967764e-05,
"loss": 0.46254016876220705,
"mean_token_accuracy": 0.8771249955892563,
"num_tokens": 17933060.0,
"step": 2650
},
{
"entropy": 0.4469280856847763,
"epoch": 1.7408123791102514,
"grad_norm": 0.2817021906375885,
"learning_rate": 8.398882441435633e-05,
"loss": 0.43881519317626955,
"mean_token_accuracy": 0.8837608104944229,
"num_tokens": 18266535.0,
"step": 2700
},
{
"entropy": 0.455581805408001,
"epoch": 1.773049645390071,
"grad_norm": 0.31535229086875916,
"learning_rate": 8.183967332903504e-05,
"loss": 0.44726665496826173,
"mean_token_accuracy": 0.8812869715690613,
"num_tokens": 18603326.0,
"step": 2750
},
{
"entropy": 0.43902623891830445,
"epoch": 1.8052869116698904,
"grad_norm": 0.2788417339324951,
"learning_rate": 7.969052224371373e-05,
"loss": 0.42899021148681643,
"mean_token_accuracy": 0.8851540559530258,
"num_tokens": 18939700.0,
"step": 2800
},
{
"entropy": 0.45259665727615356,
"epoch": 1.8375241779497098,
"grad_norm": 0.27750885486602783,
"learning_rate": 7.754137115839244e-05,
"loss": 0.4436537551879883,
"mean_token_accuracy": 0.8825727927684784,
"num_tokens": 19275565.0,
"step": 2850
},
{
"entropy": 0.43768042981624605,
"epoch": 1.8697614442295294,
"grad_norm": 0.30853450298309326,
"learning_rate": 7.539222007307113e-05,
"loss": 0.4311842346191406,
"mean_token_accuracy": 0.8850624537467957,
"num_tokens": 19607809.0,
"step": 2900
},
{
"entropy": 0.44810337752103807,
"epoch": 1.9019987105093488,
"grad_norm": 0.32159748673439026,
"learning_rate": 7.324306898774984e-05,
"loss": 0.4413007736206055,
"mean_token_accuracy": 0.8821072828769684,
"num_tokens": 19941679.0,
"step": 2950
},
{
"entropy": 0.4376507529616356,
"epoch": 1.9342359767891684,
"grad_norm": 0.28715935349464417,
"learning_rate": 7.109391790242854e-05,
"loss": 0.4271116256713867,
"mean_token_accuracy": 0.8850878685712814,
"num_tokens": 20276932.0,
"step": 3000
},
{
"entropy": 0.44526120245456696,
"epoch": 1.9664732430689877,
"grad_norm": 0.2948083281517029,
"learning_rate": 6.894476681710724e-05,
"loss": 0.43935283660888674,
"mean_token_accuracy": 0.8832118940353394,
"num_tokens": 20613740.0,
"step": 3050
},
{
"entropy": 0.44097375571727754,
"epoch": 1.9987105093488071,
"grad_norm": 0.28070375323295593,
"learning_rate": 6.679561573178594e-05,
"loss": 0.43161014556884764,
"mean_token_accuracy": 0.8843864989280701,
"num_tokens": 20948040.0,
"step": 3100
},
{
"entropy": 0.4366187188029289,
"epoch": 2.0309477756286265,
"grad_norm": 0.2711784243583679,
"learning_rate": 6.464646464646466e-05,
"loss": 0.4246902084350586,
"mean_token_accuracy": 0.8861147791147232,
"num_tokens": 21284152.0,
"step": 3150
},
{
"entropy": 0.4292546170949936,
"epoch": 2.0631850419084463,
"grad_norm": 0.3474438488483429,
"learning_rate": 6.249731356114335e-05,
"loss": 0.41976234436035154,
"mean_token_accuracy": 0.8869011825323105,
"num_tokens": 21623591.0,
"step": 3200
},
{
"entropy": 0.4441410732269287,
"epoch": 2.0954223081882657,
"grad_norm": 0.27009403705596924,
"learning_rate": 6.0348162475822054e-05,
"loss": 0.4335956192016602,
"mean_token_accuracy": 0.8844973957538604,
"num_tokens": 21961239.0,
"step": 3250
},
{
"entropy": 0.4423326799273491,
"epoch": 2.127659574468085,
"grad_norm": 0.31351885199546814,
"learning_rate": 5.8199011390500755e-05,
"loss": 0.43222076416015626,
"mean_token_accuracy": 0.8844653475284576,
"num_tokens": 22297355.0,
"step": 3300
},
{
"entropy": 0.43579984217882156,
"epoch": 2.1598968407479044,
"grad_norm": 0.3104802072048187,
"learning_rate": 5.6049860305179456e-05,
"loss": 0.42580715179443357,
"mean_token_accuracy": 0.8859012949466706,
"num_tokens": 22636061.0,
"step": 3350
},
{
"entropy": 0.4307232940196991,
"epoch": 2.192134107027724,
"grad_norm": 0.30051860213279724,
"learning_rate": 5.390070921985816e-05,
"loss": 0.41833953857421874,
"mean_token_accuracy": 0.886508920788765,
"num_tokens": 22975583.0,
"step": 3400
},
{
"entropy": 0.43692171543836594,
"epoch": 2.2243713733075436,
"grad_norm": 0.3109855353832245,
"learning_rate": 5.175155813453686e-05,
"loss": 0.4261277389526367,
"mean_token_accuracy": 0.8851550126075745,
"num_tokens": 23316198.0,
"step": 3450
},
{
"entropy": 0.42780830681324006,
"epoch": 2.256608639587363,
"grad_norm": 0.3165053725242615,
"learning_rate": 4.960240704921556e-05,
"loss": 0.41836185455322267,
"mean_token_accuracy": 0.8882633966207504,
"num_tokens": 23654932.0,
"step": 3500
},
{
"entropy": 0.4399165993928909,
"epoch": 2.2888459058671824,
"grad_norm": 0.31702736020088196,
"learning_rate": 4.745325596389427e-05,
"loss": 0.42992683410644533,
"mean_token_accuracy": 0.884578087925911,
"num_tokens": 23994334.0,
"step": 3550
},
{
"entropy": 0.44941207855939863,
"epoch": 2.3210831721470018,
"grad_norm": 0.382436066865921,
"learning_rate": 4.530410487857297e-05,
"loss": 0.43822154998779295,
"mean_token_accuracy": 0.8836333215236664,
"num_tokens": 24334916.0,
"step": 3600
},
{
"entropy": 0.43192073941230774,
"epoch": 2.3533204384268216,
"grad_norm": 0.34604012966156006,
"learning_rate": 4.315495379325167e-05,
"loss": 0.42123512268066404,
"mean_token_accuracy": 0.8872571766376496,
"num_tokens": 24671467.0,
"step": 3650
},
{
"entropy": 0.44117815017700196,
"epoch": 2.385557704706641,
"grad_norm": 0.31164106726646423,
"learning_rate": 4.100580270793037e-05,
"loss": 0.4305222702026367,
"mean_token_accuracy": 0.8850024062395095,
"num_tokens": 25007960.0,
"step": 3700
},
{
"entropy": 0.42460927098989487,
"epoch": 2.4177949709864603,
"grad_norm": 0.31209173798561096,
"learning_rate": 3.885665162260907e-05,
"loss": 0.41318531036376954,
"mean_token_accuracy": 0.8890041667222977,
"num_tokens": 25338303.0,
"step": 3750
},
{
"entropy": 0.4464882066845894,
"epoch": 2.4500322372662797,
"grad_norm": 0.330119252204895,
"learning_rate": 3.670750053728778e-05,
"loss": 0.4390181350708008,
"mean_token_accuracy": 0.8836234956979752,
"num_tokens": 25682388.0,
"step": 3800
},
{
"entropy": 0.4420609429478645,
"epoch": 2.482269503546099,
"grad_norm": 0.3061470687389374,
"learning_rate": 3.455834945196648e-05,
"loss": 0.4278445053100586,
"mean_token_accuracy": 0.8854056459665298,
"num_tokens": 26024136.0,
"step": 3850
},
{
"entropy": 0.4190295284986496,
"epoch": 2.514506769825919,
"grad_norm": 0.32077500224113464,
"learning_rate": 3.240919836664518e-05,
"loss": 0.41114852905273436,
"mean_token_accuracy": 0.8895813000202178,
"num_tokens": 26363036.0,
"step": 3900
},
{
"entropy": 0.4384055981040001,
"epoch": 2.5467440361057383,
"grad_norm": 0.3177681863307953,
"learning_rate": 3.0260047281323877e-05,
"loss": 0.4273562240600586,
"mean_token_accuracy": 0.8855825281143188,
"num_tokens": 26701951.0,
"step": 3950
},
{
"entropy": 0.43118291586637497,
"epoch": 2.5789813023855577,
"grad_norm": 0.29330846667289734,
"learning_rate": 2.8110896196002578e-05,
"loss": 0.41927295684814453,
"mean_token_accuracy": 0.8882288312911988,
"num_tokens": 27039067.0,
"step": 4000
},
{
"entropy": 0.43496464341878893,
"epoch": 2.611218568665377,
"grad_norm": 0.31839463114738464,
"learning_rate": 2.5961745110681286e-05,
"loss": 0.4239920425415039,
"mean_token_accuracy": 0.886286124587059,
"num_tokens": 27373718.0,
"step": 4050
},
{
"entropy": 0.43482948303222657,
"epoch": 2.643455834945197,
"grad_norm": 0.30345892906188965,
"learning_rate": 2.3812594025359983e-05,
"loss": 0.42235206604003905,
"mean_token_accuracy": 0.8865206915140152,
"num_tokens": 27708238.0,
"step": 4100
},
{
"entropy": 0.4274810257554054,
"epoch": 2.6756931012250162,
"grad_norm": 0.3029744029045105,
"learning_rate": 2.1663442940038688e-05,
"loss": 0.41650020599365234,
"mean_token_accuracy": 0.8881079655885696,
"num_tokens": 28041964.0,
"step": 4150
},
{
"entropy": 0.43494893968105314,
"epoch": 2.7079303675048356,
"grad_norm": 0.31539738178253174,
"learning_rate": 1.951429185471739e-05,
"loss": 0.4245531463623047,
"mean_token_accuracy": 0.8865839475393296,
"num_tokens": 28378719.0,
"step": 4200
},
{
"entropy": 0.4375846874713898,
"epoch": 2.740167633784655,
"grad_norm": 0.31120166182518005,
"learning_rate": 1.736514076939609e-05,
"loss": 0.427888069152832,
"mean_token_accuracy": 0.8849086022377014,
"num_tokens": 28718819.0,
"step": 4250
},
{
"entropy": 0.4191849535703659,
"epoch": 2.7724049000644744,
"grad_norm": 0.3305680751800537,
"learning_rate": 1.521598968407479e-05,
"loss": 0.4062779998779297,
"mean_token_accuracy": 0.8907963120937348,
"num_tokens": 29053437.0,
"step": 4300
},
{
"entropy": 0.44296603530645373,
"epoch": 2.804642166344294,
"grad_norm": 0.34950941801071167,
"learning_rate": 1.3066838598753491e-05,
"loss": 0.4340578842163086,
"mean_token_accuracy": 0.8846180647611618,
"num_tokens": 29389949.0,
"step": 4350
},
{
"entropy": 0.44456703811883924,
"epoch": 2.8368794326241136,
"grad_norm": 0.3210543096065521,
"learning_rate": 1.0917687513432196e-05,
"loss": 0.43384292602539065,
"mean_token_accuracy": 0.8840754866600037,
"num_tokens": 29728935.0,
"step": 4400
},
{
"entropy": 0.43473256975412367,
"epoch": 2.869116698903933,
"grad_norm": 0.3032950162887573,
"learning_rate": 8.768536428110897e-06,
"loss": 0.4252130126953125,
"mean_token_accuracy": 0.8865963506698609,
"num_tokens": 30065697.0,
"step": 4450
},
{
"entropy": 0.43983528643846515,
"epoch": 2.9013539651837523,
"grad_norm": 0.37149280309677124,
"learning_rate": 6.619385342789598e-06,
"loss": 0.4294190979003906,
"mean_token_accuracy": 0.8858663266897202,
"num_tokens": 30401977.0,
"step": 4500
}
],
"logging_steps": 50,
"max_steps": 4653,
"num_input_tokens_seen": 0,
"num_train_epochs": 3,
"save_steps": 500,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": false
},
"attributes": {}
}
},
"total_flos": 1.224183762523392e+17,
"train_batch_size": 16,
"trial_name": null,
"trial_params": null
}