A1minus_v4_e2 / trainer_state.json
Taywon's picture
Upload folder using huggingface_hub
0f3e646 verified
Raw
History Blame Contribute Delete
46.7 kB
{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 2.0,
"eval_steps": 500,
"global_step": 158,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"entropy": 1.3162457048892975,
"epoch": 0.0128,
"grad_norm": 1.352159857749939,
"learning_rate": 0.0,
"loss": 2.1207475662231445,
"mean_token_accuracy": 0.519522450864315,
"num_tokens": 128267.0,
"step": 1
},
{
"entropy": 1.3375049829483032,
"epoch": 0.0256,
"grad_norm": 1.3233879804611206,
"learning_rate": 4.166666666666667e-06,
"loss": 2.1054062843322754,
"mean_token_accuracy": 0.5206284299492836,
"num_tokens": 253824.0,
"step": 2
},
{
"entropy": 1.4048671871423721,
"epoch": 0.0384,
"grad_norm": 1.2062019109725952,
"learning_rate": 8.333333333333334e-06,
"loss": 2.087756633758545,
"mean_token_accuracy": 0.5199320912361145,
"num_tokens": 382699.0,
"step": 3
},
{
"entropy": 1.5049891620874405,
"epoch": 0.0512,
"grad_norm": 0.9262659549713135,
"learning_rate": 1.25e-05,
"loss": 1.995165467262268,
"mean_token_accuracy": 0.5279128178954124,
"num_tokens": 511796.0,
"step": 4
},
{
"entropy": 1.6395027190446854,
"epoch": 0.064,
"grad_norm": 0.6157782673835754,
"learning_rate": 1.6666666666666667e-05,
"loss": 1.902457594871521,
"mean_token_accuracy": 0.5378688499331474,
"num_tokens": 639293.0,
"step": 5
},
{
"entropy": 1.7712273597717285,
"epoch": 0.0768,
"grad_norm": 0.41292306780815125,
"learning_rate": 2.0833333333333336e-05,
"loss": 1.814640998840332,
"mean_token_accuracy": 0.551142543554306,
"num_tokens": 768431.0,
"step": 6
},
{
"entropy": 1.9540852010250092,
"epoch": 0.0896,
"grad_norm": 0.501342236995697,
"learning_rate": 2.5e-05,
"loss": 1.7964210510253906,
"mean_token_accuracy": 0.5524477660655975,
"num_tokens": 896030.0,
"step": 7
},
{
"entropy": 2.001556009054184,
"epoch": 0.1024,
"grad_norm": 0.5916482210159302,
"learning_rate": 2.916666666666667e-05,
"loss": 1.74098801612854,
"mean_token_accuracy": 0.5590195059776306,
"num_tokens": 1024099.0,
"step": 8
},
{
"entropy": 1.8932171761989594,
"epoch": 0.1152,
"grad_norm": 0.5141144394874573,
"learning_rate": 3.3333333333333335e-05,
"loss": 1.6654725074768066,
"mean_token_accuracy": 0.5705089494585991,
"num_tokens": 1151261.0,
"step": 9
},
{
"entropy": 1.7713737785816193,
"epoch": 0.128,
"grad_norm": 0.38611456751823425,
"learning_rate": 3.7500000000000003e-05,
"loss": 1.6301219463348389,
"mean_token_accuracy": 0.5723346620798111,
"num_tokens": 1280169.0,
"step": 10
},
{
"entropy": 1.5953099429607391,
"epoch": 0.1408,
"grad_norm": 0.3014231324195862,
"learning_rate": 4.166666666666667e-05,
"loss": 1.563348412513733,
"mean_token_accuracy": 0.5855296552181244,
"num_tokens": 1408663.0,
"step": 11
},
{
"entropy": 1.498468354344368,
"epoch": 0.1536,
"grad_norm": 0.29069405794143677,
"learning_rate": 4.5833333333333334e-05,
"loss": 1.5376625061035156,
"mean_token_accuracy": 0.5896067395806313,
"num_tokens": 1537364.0,
"step": 12
},
{
"entropy": 1.4390365332365036,
"epoch": 0.1664,
"grad_norm": 0.2850739359855652,
"learning_rate": 5e-05,
"loss": 1.5183324813842773,
"mean_token_accuracy": 0.5939378440380096,
"num_tokens": 1665784.0,
"step": 13
},
{
"entropy": 1.3894367814064026,
"epoch": 0.1792,
"grad_norm": 0.254903644323349,
"learning_rate": 4.999756310023261e-05,
"loss": 1.4691948890686035,
"mean_token_accuracy": 0.6029341071844101,
"num_tokens": 1793645.0,
"step": 14
},
{
"entropy": 1.3888143301010132,
"epoch": 0.192,
"grad_norm": 0.2366946041584015,
"learning_rate": 4.999025287600886e-05,
"loss": 1.437840461730957,
"mean_token_accuracy": 0.6058616042137146,
"num_tokens": 1923235.0,
"step": 15
},
{
"entropy": 1.38721963763237,
"epoch": 0.2048,
"grad_norm": 0.24185693264007568,
"learning_rate": 4.997807075247146e-05,
"loss": 1.388806939125061,
"mean_token_accuracy": 0.6189781129360199,
"num_tokens": 2047392.0,
"step": 16
},
{
"entropy": 1.411361888051033,
"epoch": 0.2176,
"grad_norm": 0.2459052950143814,
"learning_rate": 4.996101910454953e-05,
"loss": 1.3761913776397705,
"mean_token_accuracy": 0.6179594621062279,
"num_tokens": 2176102.0,
"step": 17
},
{
"entropy": 1.4147253632545471,
"epoch": 0.2304,
"grad_norm": 0.19693808257579803,
"learning_rate": 4.993910125649561e-05,
"loss": 1.3652762174606323,
"mean_token_accuracy": 0.621271513402462,
"num_tokens": 2306210.0,
"step": 18
},
{
"entropy": 1.3803435266017914,
"epoch": 0.2432,
"grad_norm": 0.19281397759914398,
"learning_rate": 4.991232148123761e-05,
"loss": 1.3464841842651367,
"mean_token_accuracy": 0.6208974272012711,
"num_tokens": 2435600.0,
"step": 19
},
{
"entropy": 1.35707126557827,
"epoch": 0.256,
"grad_norm": 0.18975713849067688,
"learning_rate": 4.988068499954578e-05,
"loss": 1.3281123638153076,
"mean_token_accuracy": 0.6283634603023529,
"num_tokens": 2563297.0,
"step": 20
},
{
"entropy": 1.3186347782611847,
"epoch": 0.2688,
"grad_norm": 0.18689435720443726,
"learning_rate": 4.984419797901491e-05,
"loss": 1.2913005352020264,
"mean_token_accuracy": 0.6341830417513847,
"num_tokens": 2693321.0,
"step": 21
},
{
"entropy": 1.2915433645248413,
"epoch": 0.2816,
"grad_norm": 0.16926461458206177,
"learning_rate": 4.980286753286195e-05,
"loss": 1.2752561569213867,
"mean_token_accuracy": 0.6396686807274818,
"num_tokens": 2822308.0,
"step": 22
},
{
"entropy": 1.3217644691467285,
"epoch": 0.2944,
"grad_norm": 0.17539748549461365,
"learning_rate": 4.975670171853926e-05,
"loss": 1.2967042922973633,
"mean_token_accuracy": 0.6322600916028023,
"num_tokens": 2948321.0,
"step": 23
},
{
"entropy": 1.305735170841217,
"epoch": 0.3072,
"grad_norm": 0.18748317658901215,
"learning_rate": 4.9705709536163824e-05,
"loss": 1.2801027297973633,
"mean_token_accuracy": 0.6383148655295372,
"num_tokens": 3075824.0,
"step": 24
},
{
"entropy": 1.2684594690799713,
"epoch": 0.32,
"grad_norm": 0.17818772792816162,
"learning_rate": 4.964990092676263e-05,
"loss": 1.2617098093032837,
"mean_token_accuracy": 0.6398709714412689,
"num_tokens": 3204534.0,
"step": 25
},
{
"entropy": 1.2367210537195206,
"epoch": 0.3328,
"grad_norm": 0.15789498388767242,
"learning_rate": 4.9589286770334654e-05,
"loss": 1.237747073173523,
"mean_token_accuracy": 0.6457515805959702,
"num_tokens": 3332525.0,
"step": 26
},
{
"entropy": 1.26371830701828,
"epoch": 0.3456,
"grad_norm": 0.15905392169952393,
"learning_rate": 4.952387888372979e-05,
"loss": 1.2668375968933105,
"mean_token_accuracy": 0.6412620171904564,
"num_tokens": 3461036.0,
"step": 27
},
{
"entropy": 1.2327947914600372,
"epoch": 0.3584,
"grad_norm": 0.1592377871274948,
"learning_rate": 4.9453690018345144e-05,
"loss": 1.234164834022522,
"mean_token_accuracy": 0.6465037614107132,
"num_tokens": 3589380.0,
"step": 28
},
{
"entropy": 1.225911945104599,
"epoch": 0.3712,
"grad_norm": 0.16118580102920532,
"learning_rate": 4.937873385763908e-05,
"loss": 1.2210657596588135,
"mean_token_accuracy": 0.648338608443737,
"num_tokens": 3717664.0,
"step": 29
},
{
"entropy": 1.2561272978782654,
"epoch": 0.384,
"grad_norm": 0.1599515676498413,
"learning_rate": 4.929902501446366e-05,
"loss": 1.2360204458236694,
"mean_token_accuracy": 0.6447968706488609,
"num_tokens": 3844833.0,
"step": 30
},
{
"entropy": 1.239769622683525,
"epoch": 0.3968,
"grad_norm": 0.15974652767181396,
"learning_rate": 4.9214579028215776e-05,
"loss": 1.2166938781738281,
"mean_token_accuracy": 0.6490442007780075,
"num_tokens": 3974478.0,
"step": 31
},
{
"entropy": 1.239488497376442,
"epoch": 0.4096,
"grad_norm": 0.1755683869123459,
"learning_rate": 4.912541236180779e-05,
"loss": 1.2133210897445679,
"mean_token_accuracy": 0.651265911757946,
"num_tokens": 4104263.0,
"step": 32
},
{
"entropy": 1.223443627357483,
"epoch": 0.4224,
"grad_norm": 0.15209320187568665,
"learning_rate": 4.9031542398457974e-05,
"loss": 1.202136754989624,
"mean_token_accuracy": 0.6539920642971992,
"num_tokens": 4233892.0,
"step": 33
},
{
"entropy": 1.2144603580236435,
"epoch": 0.4352,
"grad_norm": 0.1438663750886917,
"learning_rate": 4.893298743830168e-05,
"loss": 1.2046866416931152,
"mean_token_accuracy": 0.6516713947057724,
"num_tokens": 4362313.0,
"step": 34
},
{
"entropy": 1.2047844678163528,
"epoch": 0.448,
"grad_norm": 0.14309684932231903,
"learning_rate": 4.882976669482367e-05,
"loss": 1.1985797882080078,
"mean_token_accuracy": 0.6538008749485016,
"num_tokens": 4490686.0,
"step": 35
},
{
"entropy": 1.155385822057724,
"epoch": 0.4608,
"grad_norm": 0.1452430784702301,
"learning_rate": 4.8721900291112415e-05,
"loss": 1.1461997032165527,
"mean_token_accuracy": 0.6639315262436867,
"num_tokens": 4618481.0,
"step": 36
},
{
"entropy": 1.1931456923484802,
"epoch": 0.4736,
"grad_norm": 0.14111614227294922,
"learning_rate": 4.860940925593703e-05,
"loss": 1.1837263107299805,
"mean_token_accuracy": 0.6538461446762085,
"num_tokens": 4746449.0,
"step": 37
},
{
"entropy": 1.2137931138277054,
"epoch": 0.4864,
"grad_norm": 0.1422092169523239,
"learning_rate": 4.849231551964771e-05,
"loss": 1.1992123126983643,
"mean_token_accuracy": 0.6522813364863396,
"num_tokens": 4875695.0,
"step": 38
},
{
"entropy": 1.1690412908792496,
"epoch": 0.4992,
"grad_norm": 0.14533959329128265,
"learning_rate": 4.837064190990036e-05,
"loss": 1.1562764644622803,
"mean_token_accuracy": 0.6618529111146927,
"num_tokens": 5002824.0,
"step": 39
},
{
"entropy": 1.163830503821373,
"epoch": 0.512,
"grad_norm": 0.14272262156009674,
"learning_rate": 4.8244412147206284e-05,
"loss": 1.1516133546829224,
"mean_token_accuracy": 0.6619244366884232,
"num_tokens": 5132045.0,
"step": 40
},
{
"entropy": 1.148694396018982,
"epoch": 0.5248,
"grad_norm": 0.13471876084804535,
"learning_rate": 4.8113650840307834e-05,
"loss": 1.1472002267837524,
"mean_token_accuracy": 0.6657932102680206,
"num_tokens": 5261038.0,
"step": 41
},
{
"entropy": 1.1257383078336716,
"epoch": 0.5376,
"grad_norm": 0.1379338800907135,
"learning_rate": 4.797838348138086e-05,
"loss": 1.1339021921157837,
"mean_token_accuracy": 0.6660185307264328,
"num_tokens": 5388912.0,
"step": 42
},
{
"entropy": 1.1311924755573273,
"epoch": 0.5504,
"grad_norm": 0.14049763977527618,
"learning_rate": 4.783863644106502e-05,
"loss": 1.135345697402954,
"mean_token_accuracy": 0.6648508384823799,
"num_tokens": 5518618.0,
"step": 43
},
{
"entropy": 1.1455007046461105,
"epoch": 0.5632,
"grad_norm": 0.13285057246685028,
"learning_rate": 4.769443696332272e-05,
"loss": 1.1532269716262817,
"mean_token_accuracy": 0.6633262932300568,
"num_tokens": 5648116.0,
"step": 44
},
{
"entropy": 1.1428617984056473,
"epoch": 0.576,
"grad_norm": 0.13333706557750702,
"learning_rate": 4.754581316012785e-05,
"loss": 1.1316198110580444,
"mean_token_accuracy": 0.668374814093113,
"num_tokens": 5777117.0,
"step": 45
},
{
"entropy": 1.1585663259029388,
"epoch": 0.5888,
"grad_norm": 0.14425642788410187,
"learning_rate": 4.7392794005985326e-05,
"loss": 1.1365997791290283,
"mean_token_accuracy": 0.6671516969799995,
"num_tokens": 5904876.0,
"step": 46
},
{
"entropy": 1.150609478354454,
"epoch": 0.6016,
"grad_norm": 0.15504664182662964,
"learning_rate": 4.723540933228244e-05,
"loss": 1.127173662185669,
"mean_token_accuracy": 0.6687930002808571,
"num_tokens": 6034768.0,
"step": 47
},
{
"entropy": 1.1596223711967468,
"epoch": 0.6144,
"grad_norm": 0.12928146123886108,
"learning_rate": 4.707368982147318e-05,
"loss": 1.1445682048797607,
"mean_token_accuracy": 0.6648146286606789,
"num_tokens": 6163126.0,
"step": 48
},
{
"entropy": 1.0994263589382172,
"epoch": 0.6272,
"grad_norm": 0.1349116712808609,
"learning_rate": 4.690766700109659e-05,
"loss": 1.0948941707611084,
"mean_token_accuracy": 0.6754020154476166,
"num_tokens": 6291570.0,
"step": 49
},
{
"entropy": 1.112744465470314,
"epoch": 0.64,
"grad_norm": 0.14497768878936768,
"learning_rate": 4.6737373237630476e-05,
"loss": 1.1113452911376953,
"mean_token_accuracy": 0.6713321506977081,
"num_tokens": 6420084.0,
"step": 50
},
{
"entropy": 1.1346999406814575,
"epoch": 0.6528,
"grad_norm": 0.1316288709640503,
"learning_rate": 4.656284173018144e-05,
"loss": 1.1358039379119873,
"mean_token_accuracy": 0.6633565202355385,
"num_tokens": 6549817.0,
"step": 51
},
{
"entropy": 1.1398767530918121,
"epoch": 0.6656,
"grad_norm": 0.13040749728679657,
"learning_rate": 4.638410650401267e-05,
"loss": 1.1272315979003906,
"mean_token_accuracy": 0.6667839512228966,
"num_tokens": 6678766.0,
"step": 52
},
{
"entropy": 1.1322846412658691,
"epoch": 0.6784,
"grad_norm": 0.14328311383724213,
"learning_rate": 4.620120240391065e-05,
"loss": 1.117470145225525,
"mean_token_accuracy": 0.6683860421180725,
"num_tokens": 6808175.0,
"step": 53
},
{
"entropy": 1.1198230981826782,
"epoch": 0.6912,
"grad_norm": 0.14016754925251007,
"learning_rate": 4.601416508739211e-05,
"loss": 1.1076020002365112,
"mean_token_accuracy": 0.6711939796805382,
"num_tokens": 6936347.0,
"step": 54
},
{
"entropy": 1.1406737715005875,
"epoch": 0.704,
"grad_norm": 0.12862594425678253,
"learning_rate": 4.5823031017752485e-05,
"loss": 1.130237340927124,
"mean_token_accuracy": 0.6678624600172043,
"num_tokens": 7065783.0,
"step": 55
},
{
"entropy": 1.1166451126337051,
"epoch": 0.7168,
"grad_norm": 0.13933686912059784,
"learning_rate": 4.562783745695738e-05,
"loss": 1.1190818548202515,
"mean_token_accuracy": 0.6695680469274521,
"num_tokens": 7195341.0,
"step": 56
},
{
"entropy": 1.0982198119163513,
"epoch": 0.7296,
"grad_norm": 0.1453101933002472,
"learning_rate": 4.542862245837821e-05,
"loss": 1.0977050065994263,
"mean_token_accuracy": 0.673400916159153,
"num_tokens": 7323591.0,
"step": 57
},
{
"entropy": 1.1204975843429565,
"epoch": 0.7424,
"grad_norm": 0.14185063540935516,
"learning_rate": 4.522542485937369e-05,
"loss": 1.1112452745437622,
"mean_token_accuracy": 0.6700539514422417,
"num_tokens": 7449876.0,
"step": 58
},
{
"entropy": 1.0963227897882462,
"epoch": 0.7552,
"grad_norm": 0.1320878118276596,
"learning_rate": 4.5018284273718336e-05,
"loss": 1.0801842212677002,
"mean_token_accuracy": 0.6790826618671417,
"num_tokens": 7576398.0,
"step": 59
},
{
"entropy": 1.101280301809311,
"epoch": 0.768,
"grad_norm": 0.13114839792251587,
"learning_rate": 4.480724108387977e-05,
"loss": 1.0857573747634888,
"mean_token_accuracy": 0.6782229617238045,
"num_tokens": 7703463.0,
"step": 60
},
{
"entropy": 1.1046365648508072,
"epoch": 0.7808,
"grad_norm": 0.14528152346611023,
"learning_rate": 4.4592336433146e-05,
"loss": 1.0996856689453125,
"mean_token_accuracy": 0.6730064377188683,
"num_tokens": 7829441.0,
"step": 61
},
{
"entropy": 1.0932775139808655,
"epoch": 0.7936,
"grad_norm": 0.1349162608385086,
"learning_rate": 4.4373612217604496e-05,
"loss": 1.086916208267212,
"mean_token_accuracy": 0.6765137910842896,
"num_tokens": 7958502.0,
"step": 62
},
{
"entropy": 1.0945100337266922,
"epoch": 0.8064,
"grad_norm": 0.13429976999759674,
"learning_rate": 4.415111107797445e-05,
"loss": 1.0971022844314575,
"mean_token_accuracy": 0.6743359267711639,
"num_tokens": 8085295.0,
"step": 63
},
{
"entropy": 1.118965595960617,
"epoch": 0.8192,
"grad_norm": 0.1320214867591858,
"learning_rate": 4.3924876391293915e-05,
"loss": 1.1191140413284302,
"mean_token_accuracy": 0.6683387905359268,
"num_tokens": 8211901.0,
"step": 64
},
{
"entropy": 1.0775217562913895,
"epoch": 0.832,
"grad_norm": 0.13175779581069946,
"learning_rate": 4.36949522624633e-05,
"loss": 1.0712368488311768,
"mean_token_accuracy": 0.6812888830900192,
"num_tokens": 8341017.0,
"step": 65
},
{
"entropy": 1.0895331501960754,
"epoch": 0.8448,
"grad_norm": 0.13901865482330322,
"learning_rate": 4.3461383515647106e-05,
"loss": 1.0851002931594849,
"mean_token_accuracy": 0.6775127947330475,
"num_tokens": 8468968.0,
"step": 66
},
{
"entropy": 1.111844316124916,
"epoch": 0.8576,
"grad_norm": 0.1398841142654419,
"learning_rate": 4.3224215685535294e-05,
"loss": 1.1119290590286255,
"mean_token_accuracy": 0.6691920980811119,
"num_tokens": 8597358.0,
"step": 67
},
{
"entropy": 1.09650357067585,
"epoch": 0.8704,
"grad_norm": 0.12886422872543335,
"learning_rate": 4.2983495008466276e-05,
"loss": 1.0808916091918945,
"mean_token_accuracy": 0.6781075149774551,
"num_tokens": 8725371.0,
"step": 68
},
{
"entropy": 1.1017109751701355,
"epoch": 0.8832,
"grad_norm": 0.1451224386692047,
"learning_rate": 4.273926841341302e-05,
"loss": 1.0965564250946045,
"mean_token_accuracy": 0.6711221262812614,
"num_tokens": 8853595.0,
"step": 69
},
{
"entropy": 1.0767414420843124,
"epoch": 0.896,
"grad_norm": 0.13234680891036987,
"learning_rate": 4.249158351283414e-05,
"loss": 1.0748488903045654,
"mean_token_accuracy": 0.6783607006072998,
"num_tokens": 8983043.0,
"step": 70
},
{
"entropy": 1.1035151928663254,
"epoch": 0.9088,
"grad_norm": 0.14130030572414398,
"learning_rate": 4.224048859339175e-05,
"loss": 1.1003308296203613,
"mean_token_accuracy": 0.6728062555193901,
"num_tokens": 9108608.0,
"step": 71
},
{
"entropy": 1.0806768834590912,
"epoch": 0.9216,
"grad_norm": 0.13948991894721985,
"learning_rate": 4.198603260653792e-05,
"loss": 1.0670676231384277,
"mean_token_accuracy": 0.680378146469593,
"num_tokens": 9237077.0,
"step": 72
},
{
"entropy": 1.0983169227838516,
"epoch": 0.9344,
"grad_norm": 0.13928388059139252,
"learning_rate": 4.172826515897146e-05,
"loss": 1.0819404125213623,
"mean_token_accuracy": 0.6768162399530411,
"num_tokens": 9365880.0,
"step": 73
},
{
"entropy": 1.077269896864891,
"epoch": 0.9472,
"grad_norm": 0.12908564507961273,
"learning_rate": 4.146723650296701e-05,
"loss": 1.0671316385269165,
"mean_token_accuracy": 0.6830117851495743,
"num_tokens": 9495277.0,
"step": 74
},
{
"entropy": 1.0963009595870972,
"epoch": 0.96,
"grad_norm": 0.13727004826068878,
"learning_rate": 4.1202997526578276e-05,
"loss": 1.0920417308807373,
"mean_token_accuracy": 0.6739914268255234,
"num_tokens": 9622724.0,
"step": 75
},
{
"entropy": 1.0630004107952118,
"epoch": 0.9728,
"grad_norm": 0.12875896692276,
"learning_rate": 4.093559974371725e-05,
"loss": 1.0611292123794556,
"mean_token_accuracy": 0.6826749593019485,
"num_tokens": 9752552.0,
"step": 76
},
{
"entropy": 1.0773174464702606,
"epoch": 0.9856,
"grad_norm": 0.13426193594932556,
"learning_rate": 4.066509528411152e-05,
"loss": 1.0728553533554077,
"mean_token_accuracy": 0.6800747960805893,
"num_tokens": 9881931.0,
"step": 77
},
{
"entropy": 1.0630360692739487,
"epoch": 0.9984,
"grad_norm": 0.15215876698493958,
"learning_rate": 4.039153688314145e-05,
"loss": 1.0557889938354492,
"mean_token_accuracy": 0.6812136247754097,
"num_tokens": 10009540.0,
"step": 78
},
{
"entropy": 1.0610005855560303,
"epoch": 1.0,
"grad_norm": 0.3391527831554413,
"learning_rate": 4.011497787155938e-05,
"loss": 1.077329158782959,
"mean_token_accuracy": 0.6696272492408752,
"num_tokens": 10017540.0,
"step": 79
},
{
"entropy": 1.057944431900978,
"epoch": 1.0128,
"grad_norm": 0.13941514492034912,
"learning_rate": 3.983547216509254e-05,
"loss": 1.0362827777862549,
"mean_token_accuracy": 0.6861638650298119,
"num_tokens": 10145649.0,
"step": 80
},
{
"entropy": 1.067990705370903,
"epoch": 1.0256,
"grad_norm": 0.15004615485668182,
"learning_rate": 3.955307425393224e-05,
"loss": 1.0445749759674072,
"mean_token_accuracy": 0.685584768652916,
"num_tokens": 10274324.0,
"step": 81
},
{
"entropy": 1.0638910681009293,
"epoch": 1.0384,
"grad_norm": 0.15144135057926178,
"learning_rate": 3.92678391921108e-05,
"loss": 1.038772463798523,
"mean_token_accuracy": 0.6854483857750893,
"num_tokens": 10402159.0,
"step": 82
},
{
"entropy": 1.0502888560295105,
"epoch": 1.0512,
"grad_norm": 0.1476718783378601,
"learning_rate": 3.897982258676867e-05,
"loss": 1.032806396484375,
"mean_token_accuracy": 0.6877381280064583,
"num_tokens": 10528921.0,
"step": 83
},
{
"entropy": 1.0607359856367111,
"epoch": 1.064,
"grad_norm": 0.1483893245458603,
"learning_rate": 3.868908058731376e-05,
"loss": 1.0593475103378296,
"mean_token_accuracy": 0.6811802610754967,
"num_tokens": 10656940.0,
"step": 84
},
{
"entropy": 1.0237219482660294,
"epoch": 1.0768,
"grad_norm": 0.14610229432582855,
"learning_rate": 3.8395669874474915e-05,
"loss": 1.0263760089874268,
"mean_token_accuracy": 0.6873858571052551,
"num_tokens": 10785253.0,
"step": 85
},
{
"entropy": 1.0171761512756348,
"epoch": 1.0896,
"grad_norm": 0.13900278508663177,
"learning_rate": 3.8099647649251986e-05,
"loss": 1.0178409814834595,
"mean_token_accuracy": 0.6926428601145744,
"num_tokens": 10914475.0,
"step": 86
},
{
"entropy": 1.0242549777030945,
"epoch": 1.1024,
"grad_norm": 0.15527690947055817,
"learning_rate": 3.780107162176429e-05,
"loss": 1.0251739025115967,
"mean_token_accuracy": 0.690009593963623,
"num_tokens": 11043294.0,
"step": 87
},
{
"entropy": 1.0376387387514114,
"epoch": 1.1152,
"grad_norm": 0.14919476211071014,
"learning_rate": 3.7500000000000003e-05,
"loss": 1.0372812747955322,
"mean_token_accuracy": 0.6861482635140419,
"num_tokens": 11171407.0,
"step": 88
},
{
"entropy": 1.0412705391645432,
"epoch": 1.1280000000000001,
"grad_norm": 0.14314031600952148,
"learning_rate": 3.719649147846832e-05,
"loss": 1.0298428535461426,
"mean_token_accuracy": 0.6876860409975052,
"num_tokens": 11300200.0,
"step": 89
},
{
"entropy": 1.046479344367981,
"epoch": 1.1408,
"grad_norm": 0.14357109367847443,
"learning_rate": 3.689060522675689e-05,
"loss": 1.0436961650848389,
"mean_token_accuracy": 0.6840986981987953,
"num_tokens": 11427720.0,
"step": 90
},
{
"entropy": 1.0444832816720009,
"epoch": 1.1536,
"grad_norm": 0.14601631462574005,
"learning_rate": 3.6582400877996546e-05,
"loss": 1.0388257503509521,
"mean_token_accuracy": 0.6848597973585129,
"num_tokens": 11555879.0,
"step": 91
},
{
"entropy": 1.0362992137670517,
"epoch": 1.1663999999999999,
"grad_norm": 0.14069858193397522,
"learning_rate": 3.627193851723577e-05,
"loss": 1.0188350677490234,
"mean_token_accuracy": 0.6903941184282303,
"num_tokens": 11683728.0,
"step": 92
},
{
"entropy": 1.0298311412334442,
"epoch": 1.1792,
"grad_norm": 0.1387937068939209,
"learning_rate": 3.5959278669726935e-05,
"loss": 1.0166690349578857,
"mean_token_accuracy": 0.6924493312835693,
"num_tokens": 11811595.0,
"step": 93
},
{
"entropy": 1.0351728200912476,
"epoch": 1.192,
"grad_norm": 0.14132815599441528,
"learning_rate": 3.564448228912682e-05,
"loss": 1.0216882228851318,
"mean_token_accuracy": 0.6892998889088631,
"num_tokens": 11940418.0,
"step": 94
},
{
"entropy": 1.026585191488266,
"epoch": 1.2048,
"grad_norm": 0.13901017606258392,
"learning_rate": 3.532761074561355e-05,
"loss": 1.021584153175354,
"mean_token_accuracy": 0.6895899921655655,
"num_tokens": 12069893.0,
"step": 95
},
{
"entropy": 1.0406753346323967,
"epoch": 1.2176,
"grad_norm": 0.14579491317272186,
"learning_rate": 3.5008725813922386e-05,
"loss": 1.0375534296035767,
"mean_token_accuracy": 0.6865515261888504,
"num_tokens": 12197874.0,
"step": 96
},
{
"entropy": 1.0241748169064522,
"epoch": 1.2304,
"grad_norm": 0.14298036694526672,
"learning_rate": 3.4687889661302576e-05,
"loss": 1.0175296068191528,
"mean_token_accuracy": 0.6926979124546051,
"num_tokens": 12325523.0,
"step": 97
},
{
"entropy": 1.0330202355980873,
"epoch": 1.2432,
"grad_norm": 0.14852355420589447,
"learning_rate": 3.436516483539781e-05,
"loss": 1.026180624961853,
"mean_token_accuracy": 0.6885206624865532,
"num_tokens": 12453957.0,
"step": 98
},
{
"entropy": 1.031974546611309,
"epoch": 1.256,
"grad_norm": 0.1451551616191864,
"learning_rate": 3.4040614252052305e-05,
"loss": 1.029019832611084,
"mean_token_accuracy": 0.68779356777668,
"num_tokens": 12582932.0,
"step": 99
},
{
"entropy": 1.0458147823810577,
"epoch": 1.2688,
"grad_norm": 0.1469789445400238,
"learning_rate": 3.3714301183045385e-05,
"loss": 1.041419267654419,
"mean_token_accuracy": 0.6843385100364685,
"num_tokens": 12709959.0,
"step": 100
},
{
"entropy": 1.0275584980845451,
"epoch": 1.2816,
"grad_norm": 0.1412278562784195,
"learning_rate": 3.338628924375638e-05,
"loss": 1.029524326324463,
"mean_token_accuracy": 0.688622310757637,
"num_tokens": 12840008.0,
"step": 101
},
{
"entropy": 1.050063706934452,
"epoch": 1.2944,
"grad_norm": 0.14754833281040192,
"learning_rate": 3.305664238076278e-05,
"loss": 1.047257423400879,
"mean_token_accuracy": 0.6842105835676193,
"num_tokens": 12968206.0,
"step": 102
},
{
"entropy": 1.01626917719841,
"epoch": 1.3072,
"grad_norm": 0.16974866390228271,
"learning_rate": 3.272542485937369e-05,
"loss": 1.000723123550415,
"mean_token_accuracy": 0.6962596401572227,
"num_tokens": 13096100.0,
"step": 103
},
{
"entropy": 1.027530312538147,
"epoch": 1.32,
"grad_norm": 0.14281733334064484,
"learning_rate": 3.239270125110117e-05,
"loss": 1.0164220333099365,
"mean_token_accuracy": 0.6905561611056328,
"num_tokens": 13225387.0,
"step": 104
},
{
"entropy": 1.0216997936367989,
"epoch": 1.3328,
"grad_norm": 0.1458079218864441,
"learning_rate": 3.205853642107192e-05,
"loss": 1.0075095891952515,
"mean_token_accuracy": 0.6948263943195343,
"num_tokens": 13353629.0,
"step": 105
},
{
"entropy": 1.030478984117508,
"epoch": 1.3456000000000001,
"grad_norm": 0.17896829545497894,
"learning_rate": 3.172299551538164e-05,
"loss": 1.0213568210601807,
"mean_token_accuracy": 0.6878650262951851,
"num_tokens": 13479852.0,
"step": 106
},
{
"entropy": 1.039674311876297,
"epoch": 1.3584,
"grad_norm": 0.1448402851819992,
"learning_rate": 3.138614394839476e-05,
"loss": 1.042442798614502,
"mean_token_accuracy": 0.683524414896965,
"num_tokens": 13607703.0,
"step": 107
},
{
"entropy": 1.022900030016899,
"epoch": 1.3712,
"grad_norm": 0.14083491265773773,
"learning_rate": 3.104804738999169e-05,
"loss": 1.0171509981155396,
"mean_token_accuracy": 0.6908959671854973,
"num_tokens": 13735309.0,
"step": 108
},
{
"entropy": 1.0258008986711502,
"epoch": 1.384,
"grad_norm": 0.1457403004169464,
"learning_rate": 3.0708771752766394e-05,
"loss": 1.017960548400879,
"mean_token_accuracy": 0.691944383084774,
"num_tokens": 13860919.0,
"step": 109
},
{
"entropy": 1.0283809155225754,
"epoch": 1.3968,
"grad_norm": 0.14442399144172668,
"learning_rate": 3.0368383179176585e-05,
"loss": 1.0272858142852783,
"mean_token_accuracy": 0.6892063394188881,
"num_tokens": 13989591.0,
"step": 110
},
{
"entropy": 1.014742635190487,
"epoch": 1.4096,
"grad_norm": 0.14124004542827606,
"learning_rate": 3.002694802864912e-05,
"loss": 0.9993501901626587,
"mean_token_accuracy": 0.6947403773665428,
"num_tokens": 14117810.0,
"step": 111
},
{
"entropy": 1.016780748963356,
"epoch": 1.4224,
"grad_norm": 0.1471729427576065,
"learning_rate": 2.9684532864643122e-05,
"loss": 1.0125102996826172,
"mean_token_accuracy": 0.6930836960673332,
"num_tokens": 14242788.0,
"step": 112
},
{
"entropy": 1.0173302441835403,
"epoch": 1.4352,
"grad_norm": 0.13925546407699585,
"learning_rate": 2.9341204441673266e-05,
"loss": 1.0153708457946777,
"mean_token_accuracy": 0.6915621310472488,
"num_tokens": 14371615.0,
"step": 113
},
{
"entropy": 1.0239159166812897,
"epoch": 1.448,
"grad_norm": 0.14313757419586182,
"learning_rate": 2.8997029692295874e-05,
"loss": 1.0213682651519775,
"mean_token_accuracy": 0.6906882151961327,
"num_tokens": 14500253.0,
"step": 114
},
{
"entropy": 1.0035353675484657,
"epoch": 1.4607999999999999,
"grad_norm": 0.13895684480667114,
"learning_rate": 2.8652075714060295e-05,
"loss": 1.000422477722168,
"mean_token_accuracy": 0.6950262412428856,
"num_tokens": 14628433.0,
"step": 115
},
{
"entropy": 1.0296125635504723,
"epoch": 1.4736,
"grad_norm": 0.14564120769500732,
"learning_rate": 2.8306409756428064e-05,
"loss": 1.0179723501205444,
"mean_token_accuracy": 0.6900328099727631,
"num_tokens": 14756107.0,
"step": 116
},
{
"entropy": 1.0249193534255028,
"epoch": 1.4864,
"grad_norm": 0.13886931538581848,
"learning_rate": 2.7960099207662532e-05,
"loss": 1.0143296718597412,
"mean_token_accuracy": 0.6901694238185883,
"num_tokens": 14885841.0,
"step": 117
},
{
"entropy": 1.0198340266942978,
"epoch": 1.4992,
"grad_norm": 0.14387960731983185,
"learning_rate": 2.761321158169134e-05,
"loss": 1.0158933401107788,
"mean_token_accuracy": 0.693331778049469,
"num_tokens": 15014900.0,
"step": 118
},
{
"entropy": 1.0240024253726006,
"epoch": 1.512,
"grad_norm": 0.14001767337322235,
"learning_rate": 2.726581450494451e-05,
"loss": 1.0160140991210938,
"mean_token_accuracy": 0.6910362392663956,
"num_tokens": 15140121.0,
"step": 119
},
{
"entropy": 1.0351693704724312,
"epoch": 1.5248,
"grad_norm": 0.1424434930086136,
"learning_rate": 2.6917975703170466e-05,
"loss": 1.0207040309906006,
"mean_token_accuracy": 0.6915217339992523,
"num_tokens": 15268220.0,
"step": 120
},
{
"entropy": 1.0331912711262703,
"epoch": 1.5375999999999999,
"grad_norm": 0.1435452103614807,
"learning_rate": 2.656976298823284e-05,
"loss": 1.022803544998169,
"mean_token_accuracy": 0.6881031021475792,
"num_tokens": 15396740.0,
"step": 121
},
{
"entropy": 1.0098799914121628,
"epoch": 1.5504,
"grad_norm": 0.15354876220226288,
"learning_rate": 2.6221244244890336e-05,
"loss": 1.0064752101898193,
"mean_token_accuracy": 0.6923821792006493,
"num_tokens": 15525918.0,
"step": 122
},
{
"entropy": 1.0045136064291,
"epoch": 1.5632000000000001,
"grad_norm": 0.15096060931682587,
"learning_rate": 2.587248741756253e-05,
"loss": 0.9965898394584656,
"mean_token_accuracy": 0.6942028999328613,
"num_tokens": 15653798.0,
"step": 123
},
{
"entropy": 1.0153604969382286,
"epoch": 1.576,
"grad_norm": 0.1559235155582428,
"learning_rate": 2.5523560497083926e-05,
"loss": 1.0174250602722168,
"mean_token_accuracy": 0.6916217133402824,
"num_tokens": 15780901.0,
"step": 124
},
{
"entropy": 1.0135911107063293,
"epoch": 1.5888,
"grad_norm": 0.15615662932395935,
"learning_rate": 2.517453150744904e-05,
"loss": 1.0026178359985352,
"mean_token_accuracy": 0.6925746351480484,
"num_tokens": 15910081.0,
"step": 125
},
{
"entropy": 1.024174876511097,
"epoch": 1.6016,
"grad_norm": 0.14676935970783234,
"learning_rate": 2.4825468492550964e-05,
"loss": 1.0253103971481323,
"mean_token_accuracy": 0.6872480884194374,
"num_tokens": 16039988.0,
"step": 126
},
{
"entropy": 1.0215316414833069,
"epoch": 1.6143999999999998,
"grad_norm": 0.14772795140743256,
"learning_rate": 2.447643950291608e-05,
"loss": 1.0158052444458008,
"mean_token_accuracy": 0.6926918849349022,
"num_tokens": 16168000.0,
"step": 127
},
{
"entropy": 1.0269628539681435,
"epoch": 1.6272,
"grad_norm": 0.159188911318779,
"learning_rate": 2.4127512582437485e-05,
"loss": 1.0269343852996826,
"mean_token_accuracy": 0.6895755901932716,
"num_tokens": 16297540.0,
"step": 128
},
{
"entropy": 1.0223316550254822,
"epoch": 1.6400000000000001,
"grad_norm": 0.15721148252487183,
"learning_rate": 2.377875575510967e-05,
"loss": 1.0127532482147217,
"mean_token_accuracy": 0.6900231316685677,
"num_tokens": 16427044.0,
"step": 129
},
{
"entropy": 1.0085494741797447,
"epoch": 1.6528,
"grad_norm": 0.14220507442951202,
"learning_rate": 2.3430237011767167e-05,
"loss": 1.0012016296386719,
"mean_token_accuracy": 0.6937322989106178,
"num_tokens": 16556253.0,
"step": 130
},
{
"entropy": 1.0213414132595062,
"epoch": 1.6656,
"grad_norm": 0.14747366309165955,
"learning_rate": 2.3082024296829536e-05,
"loss": 1.0079940557479858,
"mean_token_accuracy": 0.6933478713035583,
"num_tokens": 16684674.0,
"step": 131
},
{
"entropy": 0.9775404036045074,
"epoch": 1.6784,
"grad_norm": 0.14372865855693817,
"learning_rate": 2.2734185495055503e-05,
"loss": 0.9752405285835266,
"mean_token_accuracy": 0.6997648701071739,
"num_tokens": 16813433.0,
"step": 132
},
{
"entropy": 1.0255391001701355,
"epoch": 1.6912,
"grad_norm": 0.14679594337940216,
"learning_rate": 2.238678841830867e-05,
"loss": 1.0157995223999023,
"mean_token_accuracy": 0.6912272796034813,
"num_tokens": 16942464.0,
"step": 133
},
{
"entropy": 1.0093939751386642,
"epoch": 1.704,
"grad_norm": 0.14213216304779053,
"learning_rate": 2.2039900792337474e-05,
"loss": 1.0053470134735107,
"mean_token_accuracy": 0.6922042742371559,
"num_tokens": 17068724.0,
"step": 134
},
{
"entropy": 1.0206375867128372,
"epoch": 1.7168,
"grad_norm": 0.1582878679037094,
"learning_rate": 2.1693590243571938e-05,
"loss": 1.015845537185669,
"mean_token_accuracy": 0.6909609735012054,
"num_tokens": 17197871.0,
"step": 135
},
{
"entropy": 1.0280367136001587,
"epoch": 1.7296,
"grad_norm": 0.14381150901317596,
"learning_rate": 2.1347924285939714e-05,
"loss": 1.0239794254302979,
"mean_token_accuracy": 0.690137580037117,
"num_tokens": 17327107.0,
"step": 136
},
{
"entropy": 1.0049420967698097,
"epoch": 1.7424,
"grad_norm": 0.13888318836688995,
"learning_rate": 2.1002970307704132e-05,
"loss": 0.9952517747879028,
"mean_token_accuracy": 0.696092315018177,
"num_tokens": 17455256.0,
"step": 137
},
{
"entropy": 1.0143049955368042,
"epoch": 1.7551999999999999,
"grad_norm": 0.14273257553577423,
"learning_rate": 2.0658795558326743e-05,
"loss": 1.0057284832000732,
"mean_token_accuracy": 0.6924818381667137,
"num_tokens": 17584010.0,
"step": 138
},
{
"entropy": 0.9956570863723755,
"epoch": 1.768,
"grad_norm": 0.14681822061538696,
"learning_rate": 2.031546713535688e-05,
"loss": 0.9961063265800476,
"mean_token_accuracy": 0.695470467209816,
"num_tokens": 17712152.0,
"step": 139
},
{
"entropy": 1.002347745001316,
"epoch": 1.7808000000000002,
"grad_norm": 0.1409362256526947,
"learning_rate": 1.9973051971350888e-05,
"loss": 0.9963667392730713,
"mean_token_accuracy": 0.6953927576541901,
"num_tokens": 17841435.0,
"step": 140
},
{
"entropy": 1.001997910439968,
"epoch": 1.7936,
"grad_norm": 0.1434098333120346,
"learning_rate": 1.963161682082342e-05,
"loss": 0.9935073256492615,
"mean_token_accuracy": 0.6966547071933746,
"num_tokens": 17970685.0,
"step": 141
},
{
"entropy": 0.9948462694883347,
"epoch": 1.8064,
"grad_norm": 0.1479790061712265,
"learning_rate": 1.9291228247233605e-05,
"loss": 0.9818427562713623,
"mean_token_accuracy": 0.6990911811590195,
"num_tokens": 18097293.0,
"step": 142
},
{
"entropy": 0.9982151091098785,
"epoch": 1.8192,
"grad_norm": 0.1407081037759781,
"learning_rate": 1.895195261000831e-05,
"loss": 0.990318775177002,
"mean_token_accuracy": 0.6987427324056625,
"num_tokens": 18225428.0,
"step": 143
},
{
"entropy": 1.0017137452960014,
"epoch": 1.8319999999999999,
"grad_norm": 0.14032679796218872,
"learning_rate": 1.8613856051605243e-05,
"loss": 0.999521017074585,
"mean_token_accuracy": 0.6932288855314255,
"num_tokens": 18353477.0,
"step": 144
},
{
"entropy": 1.0164642632007599,
"epoch": 1.8448,
"grad_norm": 0.14262859523296356,
"learning_rate": 1.827700448461836e-05,
"loss": 1.0056393146514893,
"mean_token_accuracy": 0.6931333243846893,
"num_tokens": 18483688.0,
"step": 145
},
{
"entropy": 0.9947623461484909,
"epoch": 1.8576000000000001,
"grad_norm": 0.14257821440696716,
"learning_rate": 1.7941463578928086e-05,
"loss": 1.0008827447891235,
"mean_token_accuracy": 0.6947742477059364,
"num_tokens": 18611470.0,
"step": 146
},
{
"entropy": 1.0136389061808586,
"epoch": 1.8704,
"grad_norm": 0.1465529501438141,
"learning_rate": 1.7607298748898842e-05,
"loss": 1.0022717714309692,
"mean_token_accuracy": 0.6935647279024124,
"num_tokens": 18739417.0,
"step": 147
},
{
"entropy": 0.9927093759179115,
"epoch": 1.8832,
"grad_norm": 0.13819244503974915,
"learning_rate": 1.7274575140626318e-05,
"loss": 0.979236900806427,
"mean_token_accuracy": 0.6986266896128654,
"num_tokens": 18868633.0,
"step": 148
},
{
"entropy": 0.9977058917284012,
"epoch": 1.896,
"grad_norm": 0.14210258424282074,
"learning_rate": 1.6943357619237226e-05,
"loss": 0.9892839193344116,
"mean_token_accuracy": 0.6953017637133598,
"num_tokens": 18997174.0,
"step": 149
},
{
"entropy": 1.0145854726433754,
"epoch": 1.9088,
"grad_norm": 0.14142665266990662,
"learning_rate": 1.6613710756243626e-05,
"loss": 1.0118539333343506,
"mean_token_accuracy": 0.6924030184745789,
"num_tokens": 19126262.0,
"step": 150
},
{
"entropy": 0.9954518750309944,
"epoch": 1.9216,
"grad_norm": 0.1441740244626999,
"learning_rate": 1.6285698816954624e-05,
"loss": 0.9903876781463623,
"mean_token_accuracy": 0.6964381784200668,
"num_tokens": 19255187.0,
"step": 151
},
{
"entropy": 0.999088779091835,
"epoch": 1.9344000000000001,
"grad_norm": 0.14101152122020721,
"learning_rate": 1.5959385747947698e-05,
"loss": 0.99430912733078,
"mean_token_accuracy": 0.6954821571707726,
"num_tokens": 19382468.0,
"step": 152
},
{
"entropy": 1.0051404386758804,
"epoch": 1.9472,
"grad_norm": 0.14272092282772064,
"learning_rate": 1.56348351646022e-05,
"loss": 1.0007083415985107,
"mean_token_accuracy": 0.6927858367562294,
"num_tokens": 19512195.0,
"step": 153
},
{
"entropy": 1.021784469485283,
"epoch": 1.96,
"grad_norm": 0.1406528651714325,
"learning_rate": 1.5312110338697426e-05,
"loss": 1.0162166357040405,
"mean_token_accuracy": 0.6914241835474968,
"num_tokens": 19642358.0,
"step": 154
},
{
"entropy": 0.9982958510518074,
"epoch": 1.9727999999999999,
"grad_norm": 0.144367054104805,
"learning_rate": 1.4991274186077632e-05,
"loss": 0.994674026966095,
"mean_token_accuracy": 0.6925558745861053,
"num_tokens": 19769861.0,
"step": 155
},
{
"entropy": 1.0118654742836952,
"epoch": 1.9856,
"grad_norm": 0.14789123833179474,
"learning_rate": 1.467238925438646e-05,
"loss": 1.0072314739227295,
"mean_token_accuracy": 0.6919693425297737,
"num_tokens": 19898556.0,
"step": 156
},
{
"entropy": 1.004975602030754,
"epoch": 1.9984,
"grad_norm": 0.14627470076084137,
"learning_rate": 1.4355517710873184e-05,
"loss": 0.996126651763916,
"mean_token_accuracy": 0.694159097969532,
"num_tokens": 20026889.0,
"step": 157
},
{
"entropy": 1.0182693004608154,
"epoch": 2.0,
"grad_norm": 0.37654629349708557,
"learning_rate": 1.4040721330273062e-05,
"loss": 0.9920079708099365,
"mean_token_accuracy": 0.6773799061775208,
"num_tokens": 20035080.0,
"step": 158
}
],
"logging_steps": 1,
"max_steps": 237,
"num_input_tokens_seen": 0,
"num_train_epochs": 3,
"save_steps": 500,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": false
},
"attributes": {}
}
},
"total_flos": 2.1153161977077432e+18,
"train_batch_size": 1,
"trial_name": null,
"trial_params": null
}