A1minus_v4_e1 / trainer_state.json
Taywon's picture
Upload folder using huggingface_hub
3a7501b verified
Raw
History Blame Contribute Delete
23.5 kB
{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 1.0,
"eval_steps": 500,
"global_step": 79,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"entropy": 1.3162457048892975,
"epoch": 0.0128,
"grad_norm": 1.352159857749939,
"learning_rate": 0.0,
"loss": 2.1207475662231445,
"mean_token_accuracy": 0.519522450864315,
"num_tokens": 128267.0,
"step": 1
},
{
"entropy": 1.3375049829483032,
"epoch": 0.0256,
"grad_norm": 1.3233879804611206,
"learning_rate": 4.166666666666667e-06,
"loss": 2.1054062843322754,
"mean_token_accuracy": 0.5206284299492836,
"num_tokens": 253824.0,
"step": 2
},
{
"entropy": 1.4048671871423721,
"epoch": 0.0384,
"grad_norm": 1.2062019109725952,
"learning_rate": 8.333333333333334e-06,
"loss": 2.087756633758545,
"mean_token_accuracy": 0.5199320912361145,
"num_tokens": 382699.0,
"step": 3
},
{
"entropy": 1.5049891620874405,
"epoch": 0.0512,
"grad_norm": 0.9262659549713135,
"learning_rate": 1.25e-05,
"loss": 1.995165467262268,
"mean_token_accuracy": 0.5279128178954124,
"num_tokens": 511796.0,
"step": 4
},
{
"entropy": 1.6395027190446854,
"epoch": 0.064,
"grad_norm": 0.6157782673835754,
"learning_rate": 1.6666666666666667e-05,
"loss": 1.902457594871521,
"mean_token_accuracy": 0.5378688499331474,
"num_tokens": 639293.0,
"step": 5
},
{
"entropy": 1.7712273597717285,
"epoch": 0.0768,
"grad_norm": 0.41292306780815125,
"learning_rate": 2.0833333333333336e-05,
"loss": 1.814640998840332,
"mean_token_accuracy": 0.551142543554306,
"num_tokens": 768431.0,
"step": 6
},
{
"entropy": 1.9540852010250092,
"epoch": 0.0896,
"grad_norm": 0.501342236995697,
"learning_rate": 2.5e-05,
"loss": 1.7964210510253906,
"mean_token_accuracy": 0.5524477660655975,
"num_tokens": 896030.0,
"step": 7
},
{
"entropy": 2.001556009054184,
"epoch": 0.1024,
"grad_norm": 0.5916482210159302,
"learning_rate": 2.916666666666667e-05,
"loss": 1.74098801612854,
"mean_token_accuracy": 0.5590195059776306,
"num_tokens": 1024099.0,
"step": 8
},
{
"entropy": 1.8932171761989594,
"epoch": 0.1152,
"grad_norm": 0.5141144394874573,
"learning_rate": 3.3333333333333335e-05,
"loss": 1.6654725074768066,
"mean_token_accuracy": 0.5705089494585991,
"num_tokens": 1151261.0,
"step": 9
},
{
"entropy": 1.7713737785816193,
"epoch": 0.128,
"grad_norm": 0.38611456751823425,
"learning_rate": 3.7500000000000003e-05,
"loss": 1.6301219463348389,
"mean_token_accuracy": 0.5723346620798111,
"num_tokens": 1280169.0,
"step": 10
},
{
"entropy": 1.5953099429607391,
"epoch": 0.1408,
"grad_norm": 0.3014231324195862,
"learning_rate": 4.166666666666667e-05,
"loss": 1.563348412513733,
"mean_token_accuracy": 0.5855296552181244,
"num_tokens": 1408663.0,
"step": 11
},
{
"entropy": 1.498468354344368,
"epoch": 0.1536,
"grad_norm": 0.29069405794143677,
"learning_rate": 4.5833333333333334e-05,
"loss": 1.5376625061035156,
"mean_token_accuracy": 0.5896067395806313,
"num_tokens": 1537364.0,
"step": 12
},
{
"entropy": 1.4390365332365036,
"epoch": 0.1664,
"grad_norm": 0.2850739359855652,
"learning_rate": 5e-05,
"loss": 1.5183324813842773,
"mean_token_accuracy": 0.5939378440380096,
"num_tokens": 1665784.0,
"step": 13
},
{
"entropy": 1.3894367814064026,
"epoch": 0.1792,
"grad_norm": 0.254903644323349,
"learning_rate": 4.999756310023261e-05,
"loss": 1.4691948890686035,
"mean_token_accuracy": 0.6029341071844101,
"num_tokens": 1793645.0,
"step": 14
},
{
"entropy": 1.3888143301010132,
"epoch": 0.192,
"grad_norm": 0.2366946041584015,
"learning_rate": 4.999025287600886e-05,
"loss": 1.437840461730957,
"mean_token_accuracy": 0.6058616042137146,
"num_tokens": 1923235.0,
"step": 15
},
{
"entropy": 1.38721963763237,
"epoch": 0.2048,
"grad_norm": 0.24185693264007568,
"learning_rate": 4.997807075247146e-05,
"loss": 1.388806939125061,
"mean_token_accuracy": 0.6189781129360199,
"num_tokens": 2047392.0,
"step": 16
},
{
"entropy": 1.411361888051033,
"epoch": 0.2176,
"grad_norm": 0.2459052950143814,
"learning_rate": 4.996101910454953e-05,
"loss": 1.3761913776397705,
"mean_token_accuracy": 0.6179594621062279,
"num_tokens": 2176102.0,
"step": 17
},
{
"entropy": 1.4147253632545471,
"epoch": 0.2304,
"grad_norm": 0.19693808257579803,
"learning_rate": 4.993910125649561e-05,
"loss": 1.3652762174606323,
"mean_token_accuracy": 0.621271513402462,
"num_tokens": 2306210.0,
"step": 18
},
{
"entropy": 1.3803435266017914,
"epoch": 0.2432,
"grad_norm": 0.19281397759914398,
"learning_rate": 4.991232148123761e-05,
"loss": 1.3464841842651367,
"mean_token_accuracy": 0.6208974272012711,
"num_tokens": 2435600.0,
"step": 19
},
{
"entropy": 1.35707126557827,
"epoch": 0.256,
"grad_norm": 0.18975713849067688,
"learning_rate": 4.988068499954578e-05,
"loss": 1.3281123638153076,
"mean_token_accuracy": 0.6283634603023529,
"num_tokens": 2563297.0,
"step": 20
},
{
"entropy": 1.3186347782611847,
"epoch": 0.2688,
"grad_norm": 0.18689435720443726,
"learning_rate": 4.984419797901491e-05,
"loss": 1.2913005352020264,
"mean_token_accuracy": 0.6341830417513847,
"num_tokens": 2693321.0,
"step": 21
},
{
"entropy": 1.2915433645248413,
"epoch": 0.2816,
"grad_norm": 0.16926461458206177,
"learning_rate": 4.980286753286195e-05,
"loss": 1.2752561569213867,
"mean_token_accuracy": 0.6396686807274818,
"num_tokens": 2822308.0,
"step": 22
},
{
"entropy": 1.3217644691467285,
"epoch": 0.2944,
"grad_norm": 0.17539748549461365,
"learning_rate": 4.975670171853926e-05,
"loss": 1.2967042922973633,
"mean_token_accuracy": 0.6322600916028023,
"num_tokens": 2948321.0,
"step": 23
},
{
"entropy": 1.305735170841217,
"epoch": 0.3072,
"grad_norm": 0.18748317658901215,
"learning_rate": 4.9705709536163824e-05,
"loss": 1.2801027297973633,
"mean_token_accuracy": 0.6383148655295372,
"num_tokens": 3075824.0,
"step": 24
},
{
"entropy": 1.2684594690799713,
"epoch": 0.32,
"grad_norm": 0.17818772792816162,
"learning_rate": 4.964990092676263e-05,
"loss": 1.2617098093032837,
"mean_token_accuracy": 0.6398709714412689,
"num_tokens": 3204534.0,
"step": 25
},
{
"entropy": 1.2367210537195206,
"epoch": 0.3328,
"grad_norm": 0.15789498388767242,
"learning_rate": 4.9589286770334654e-05,
"loss": 1.237747073173523,
"mean_token_accuracy": 0.6457515805959702,
"num_tokens": 3332525.0,
"step": 26
},
{
"entropy": 1.26371830701828,
"epoch": 0.3456,
"grad_norm": 0.15905392169952393,
"learning_rate": 4.952387888372979e-05,
"loss": 1.2668375968933105,
"mean_token_accuracy": 0.6412620171904564,
"num_tokens": 3461036.0,
"step": 27
},
{
"entropy": 1.2327947914600372,
"epoch": 0.3584,
"grad_norm": 0.1592377871274948,
"learning_rate": 4.9453690018345144e-05,
"loss": 1.234164834022522,
"mean_token_accuracy": 0.6465037614107132,
"num_tokens": 3589380.0,
"step": 28
},
{
"entropy": 1.225911945104599,
"epoch": 0.3712,
"grad_norm": 0.16118580102920532,
"learning_rate": 4.937873385763908e-05,
"loss": 1.2210657596588135,
"mean_token_accuracy": 0.648338608443737,
"num_tokens": 3717664.0,
"step": 29
},
{
"entropy": 1.2561272978782654,
"epoch": 0.384,
"grad_norm": 0.1599515676498413,
"learning_rate": 4.929902501446366e-05,
"loss": 1.2360204458236694,
"mean_token_accuracy": 0.6447968706488609,
"num_tokens": 3844833.0,
"step": 30
},
{
"entropy": 1.239769622683525,
"epoch": 0.3968,
"grad_norm": 0.15974652767181396,
"learning_rate": 4.9214579028215776e-05,
"loss": 1.2166938781738281,
"mean_token_accuracy": 0.6490442007780075,
"num_tokens": 3974478.0,
"step": 31
},
{
"entropy": 1.239488497376442,
"epoch": 0.4096,
"grad_norm": 0.1755683869123459,
"learning_rate": 4.912541236180779e-05,
"loss": 1.2133210897445679,
"mean_token_accuracy": 0.651265911757946,
"num_tokens": 4104263.0,
"step": 32
},
{
"entropy": 1.223443627357483,
"epoch": 0.4224,
"grad_norm": 0.15209320187568665,
"learning_rate": 4.9031542398457974e-05,
"loss": 1.202136754989624,
"mean_token_accuracy": 0.6539920642971992,
"num_tokens": 4233892.0,
"step": 33
},
{
"entropy": 1.2144603580236435,
"epoch": 0.4352,
"grad_norm": 0.1438663750886917,
"learning_rate": 4.893298743830168e-05,
"loss": 1.2046866416931152,
"mean_token_accuracy": 0.6516713947057724,
"num_tokens": 4362313.0,
"step": 34
},
{
"entropy": 1.2047844678163528,
"epoch": 0.448,
"grad_norm": 0.14309684932231903,
"learning_rate": 4.882976669482367e-05,
"loss": 1.1985797882080078,
"mean_token_accuracy": 0.6538008749485016,
"num_tokens": 4490686.0,
"step": 35
},
{
"entropy": 1.155385822057724,
"epoch": 0.4608,
"grad_norm": 0.1452430784702301,
"learning_rate": 4.8721900291112415e-05,
"loss": 1.1461997032165527,
"mean_token_accuracy": 0.6639315262436867,
"num_tokens": 4618481.0,
"step": 36
},
{
"entropy": 1.1931456923484802,
"epoch": 0.4736,
"grad_norm": 0.14111614227294922,
"learning_rate": 4.860940925593703e-05,
"loss": 1.1837263107299805,
"mean_token_accuracy": 0.6538461446762085,
"num_tokens": 4746449.0,
"step": 37
},
{
"entropy": 1.2137931138277054,
"epoch": 0.4864,
"grad_norm": 0.1422092169523239,
"learning_rate": 4.849231551964771e-05,
"loss": 1.1992123126983643,
"mean_token_accuracy": 0.6522813364863396,
"num_tokens": 4875695.0,
"step": 38
},
{
"entropy": 1.1690412908792496,
"epoch": 0.4992,
"grad_norm": 0.14533959329128265,
"learning_rate": 4.837064190990036e-05,
"loss": 1.1562764644622803,
"mean_token_accuracy": 0.6618529111146927,
"num_tokens": 5002824.0,
"step": 39
},
{
"entropy": 1.163830503821373,
"epoch": 0.512,
"grad_norm": 0.14272262156009674,
"learning_rate": 4.8244412147206284e-05,
"loss": 1.1516133546829224,
"mean_token_accuracy": 0.6619244366884232,
"num_tokens": 5132045.0,
"step": 40
},
{
"entropy": 1.148694396018982,
"epoch": 0.5248,
"grad_norm": 0.13471876084804535,
"learning_rate": 4.8113650840307834e-05,
"loss": 1.1472002267837524,
"mean_token_accuracy": 0.6657932102680206,
"num_tokens": 5261038.0,
"step": 41
},
{
"entropy": 1.1257383078336716,
"epoch": 0.5376,
"grad_norm": 0.1379338800907135,
"learning_rate": 4.797838348138086e-05,
"loss": 1.1339021921157837,
"mean_token_accuracy": 0.6660185307264328,
"num_tokens": 5388912.0,
"step": 42
},
{
"entropy": 1.1311924755573273,
"epoch": 0.5504,
"grad_norm": 0.14049763977527618,
"learning_rate": 4.783863644106502e-05,
"loss": 1.135345697402954,
"mean_token_accuracy": 0.6648508384823799,
"num_tokens": 5518618.0,
"step": 43
},
{
"entropy": 1.1455007046461105,
"epoch": 0.5632,
"grad_norm": 0.13285057246685028,
"learning_rate": 4.769443696332272e-05,
"loss": 1.1532269716262817,
"mean_token_accuracy": 0.6633262932300568,
"num_tokens": 5648116.0,
"step": 44
},
{
"entropy": 1.1428617984056473,
"epoch": 0.576,
"grad_norm": 0.13333706557750702,
"learning_rate": 4.754581316012785e-05,
"loss": 1.1316198110580444,
"mean_token_accuracy": 0.668374814093113,
"num_tokens": 5777117.0,
"step": 45
},
{
"entropy": 1.1585663259029388,
"epoch": 0.5888,
"grad_norm": 0.14425642788410187,
"learning_rate": 4.7392794005985326e-05,
"loss": 1.1365997791290283,
"mean_token_accuracy": 0.6671516969799995,
"num_tokens": 5904876.0,
"step": 46
},
{
"entropy": 1.150609478354454,
"epoch": 0.6016,
"grad_norm": 0.15504664182662964,
"learning_rate": 4.723540933228244e-05,
"loss": 1.127173662185669,
"mean_token_accuracy": 0.6687930002808571,
"num_tokens": 6034768.0,
"step": 47
},
{
"entropy": 1.1596223711967468,
"epoch": 0.6144,
"grad_norm": 0.12928146123886108,
"learning_rate": 4.707368982147318e-05,
"loss": 1.1445682048797607,
"mean_token_accuracy": 0.6648146286606789,
"num_tokens": 6163126.0,
"step": 48
},
{
"entropy": 1.0994263589382172,
"epoch": 0.6272,
"grad_norm": 0.1349116712808609,
"learning_rate": 4.690766700109659e-05,
"loss": 1.0948941707611084,
"mean_token_accuracy": 0.6754020154476166,
"num_tokens": 6291570.0,
"step": 49
},
{
"entropy": 1.112744465470314,
"epoch": 0.64,
"grad_norm": 0.14497768878936768,
"learning_rate": 4.6737373237630476e-05,
"loss": 1.1113452911376953,
"mean_token_accuracy": 0.6713321506977081,
"num_tokens": 6420084.0,
"step": 50
},
{
"entropy": 1.1346999406814575,
"epoch": 0.6528,
"grad_norm": 0.1316288709640503,
"learning_rate": 4.656284173018144e-05,
"loss": 1.1358039379119873,
"mean_token_accuracy": 0.6633565202355385,
"num_tokens": 6549817.0,
"step": 51
},
{
"entropy": 1.1398767530918121,
"epoch": 0.6656,
"grad_norm": 0.13040749728679657,
"learning_rate": 4.638410650401267e-05,
"loss": 1.1272315979003906,
"mean_token_accuracy": 0.6667839512228966,
"num_tokens": 6678766.0,
"step": 52
},
{
"entropy": 1.1322846412658691,
"epoch": 0.6784,
"grad_norm": 0.14328311383724213,
"learning_rate": 4.620120240391065e-05,
"loss": 1.117470145225525,
"mean_token_accuracy": 0.6683860421180725,
"num_tokens": 6808175.0,
"step": 53
},
{
"entropy": 1.1198230981826782,
"epoch": 0.6912,
"grad_norm": 0.14016754925251007,
"learning_rate": 4.601416508739211e-05,
"loss": 1.1076020002365112,
"mean_token_accuracy": 0.6711939796805382,
"num_tokens": 6936347.0,
"step": 54
},
{
"entropy": 1.1406737715005875,
"epoch": 0.704,
"grad_norm": 0.12862594425678253,
"learning_rate": 4.5823031017752485e-05,
"loss": 1.130237340927124,
"mean_token_accuracy": 0.6678624600172043,
"num_tokens": 7065783.0,
"step": 55
},
{
"entropy": 1.1166451126337051,
"epoch": 0.7168,
"grad_norm": 0.13933686912059784,
"learning_rate": 4.562783745695738e-05,
"loss": 1.1190818548202515,
"mean_token_accuracy": 0.6695680469274521,
"num_tokens": 7195341.0,
"step": 56
},
{
"entropy": 1.0982198119163513,
"epoch": 0.7296,
"grad_norm": 0.1453101933002472,
"learning_rate": 4.542862245837821e-05,
"loss": 1.0977050065994263,
"mean_token_accuracy": 0.673400916159153,
"num_tokens": 7323591.0,
"step": 57
},
{
"entropy": 1.1204975843429565,
"epoch": 0.7424,
"grad_norm": 0.14185063540935516,
"learning_rate": 4.522542485937369e-05,
"loss": 1.1112452745437622,
"mean_token_accuracy": 0.6700539514422417,
"num_tokens": 7449876.0,
"step": 58
},
{
"entropy": 1.0963227897882462,
"epoch": 0.7552,
"grad_norm": 0.1320878118276596,
"learning_rate": 4.5018284273718336e-05,
"loss": 1.0801842212677002,
"mean_token_accuracy": 0.6790826618671417,
"num_tokens": 7576398.0,
"step": 59
},
{
"entropy": 1.101280301809311,
"epoch": 0.768,
"grad_norm": 0.13114839792251587,
"learning_rate": 4.480724108387977e-05,
"loss": 1.0857573747634888,
"mean_token_accuracy": 0.6782229617238045,
"num_tokens": 7703463.0,
"step": 60
},
{
"entropy": 1.1046365648508072,
"epoch": 0.7808,
"grad_norm": 0.14528152346611023,
"learning_rate": 4.4592336433146e-05,
"loss": 1.0996856689453125,
"mean_token_accuracy": 0.6730064377188683,
"num_tokens": 7829441.0,
"step": 61
},
{
"entropy": 1.0932775139808655,
"epoch": 0.7936,
"grad_norm": 0.1349162608385086,
"learning_rate": 4.4373612217604496e-05,
"loss": 1.086916208267212,
"mean_token_accuracy": 0.6765137910842896,
"num_tokens": 7958502.0,
"step": 62
},
{
"entropy": 1.0945100337266922,
"epoch": 0.8064,
"grad_norm": 0.13429976999759674,
"learning_rate": 4.415111107797445e-05,
"loss": 1.0971022844314575,
"mean_token_accuracy": 0.6743359267711639,
"num_tokens": 8085295.0,
"step": 63
},
{
"entropy": 1.118965595960617,
"epoch": 0.8192,
"grad_norm": 0.1320214867591858,
"learning_rate": 4.3924876391293915e-05,
"loss": 1.1191140413284302,
"mean_token_accuracy": 0.6683387905359268,
"num_tokens": 8211901.0,
"step": 64
},
{
"entropy": 1.0775217562913895,
"epoch": 0.832,
"grad_norm": 0.13175779581069946,
"learning_rate": 4.36949522624633e-05,
"loss": 1.0712368488311768,
"mean_token_accuracy": 0.6812888830900192,
"num_tokens": 8341017.0,
"step": 65
},
{
"entropy": 1.0895331501960754,
"epoch": 0.8448,
"grad_norm": 0.13901865482330322,
"learning_rate": 4.3461383515647106e-05,
"loss": 1.0851002931594849,
"mean_token_accuracy": 0.6775127947330475,
"num_tokens": 8468968.0,
"step": 66
},
{
"entropy": 1.111844316124916,
"epoch": 0.8576,
"grad_norm": 0.1398841142654419,
"learning_rate": 4.3224215685535294e-05,
"loss": 1.1119290590286255,
"mean_token_accuracy": 0.6691920980811119,
"num_tokens": 8597358.0,
"step": 67
},
{
"entropy": 1.09650357067585,
"epoch": 0.8704,
"grad_norm": 0.12886422872543335,
"learning_rate": 4.2983495008466276e-05,
"loss": 1.0808916091918945,
"mean_token_accuracy": 0.6781075149774551,
"num_tokens": 8725371.0,
"step": 68
},
{
"entropy": 1.1017109751701355,
"epoch": 0.8832,
"grad_norm": 0.1451224386692047,
"learning_rate": 4.273926841341302e-05,
"loss": 1.0965564250946045,
"mean_token_accuracy": 0.6711221262812614,
"num_tokens": 8853595.0,
"step": 69
},
{
"entropy": 1.0767414420843124,
"epoch": 0.896,
"grad_norm": 0.13234680891036987,
"learning_rate": 4.249158351283414e-05,
"loss": 1.0748488903045654,
"mean_token_accuracy": 0.6783607006072998,
"num_tokens": 8983043.0,
"step": 70
},
{
"entropy": 1.1035151928663254,
"epoch": 0.9088,
"grad_norm": 0.14130030572414398,
"learning_rate": 4.224048859339175e-05,
"loss": 1.1003308296203613,
"mean_token_accuracy": 0.6728062555193901,
"num_tokens": 9108608.0,
"step": 71
},
{
"entropy": 1.0806768834590912,
"epoch": 0.9216,
"grad_norm": 0.13948991894721985,
"learning_rate": 4.198603260653792e-05,
"loss": 1.0670676231384277,
"mean_token_accuracy": 0.680378146469593,
"num_tokens": 9237077.0,
"step": 72
},
{
"entropy": 1.0983169227838516,
"epoch": 0.9344,
"grad_norm": 0.13928388059139252,
"learning_rate": 4.172826515897146e-05,
"loss": 1.0819404125213623,
"mean_token_accuracy": 0.6768162399530411,
"num_tokens": 9365880.0,
"step": 73
},
{
"entropy": 1.077269896864891,
"epoch": 0.9472,
"grad_norm": 0.12908564507961273,
"learning_rate": 4.146723650296701e-05,
"loss": 1.0671316385269165,
"mean_token_accuracy": 0.6830117851495743,
"num_tokens": 9495277.0,
"step": 74
},
{
"entropy": 1.0963009595870972,
"epoch": 0.96,
"grad_norm": 0.13727004826068878,
"learning_rate": 4.1202997526578276e-05,
"loss": 1.0920417308807373,
"mean_token_accuracy": 0.6739914268255234,
"num_tokens": 9622724.0,
"step": 75
},
{
"entropy": 1.0630004107952118,
"epoch": 0.9728,
"grad_norm": 0.12875896692276,
"learning_rate": 4.093559974371725e-05,
"loss": 1.0611292123794556,
"mean_token_accuracy": 0.6826749593019485,
"num_tokens": 9752552.0,
"step": 76
},
{
"entropy": 1.0773174464702606,
"epoch": 0.9856,
"grad_norm": 0.13426193594932556,
"learning_rate": 4.066509528411152e-05,
"loss": 1.0728553533554077,
"mean_token_accuracy": 0.6800747960805893,
"num_tokens": 9881931.0,
"step": 77
},
{
"entropy": 1.0630360692739487,
"epoch": 0.9984,
"grad_norm": 0.15215876698493958,
"learning_rate": 4.039153688314145e-05,
"loss": 1.0557889938354492,
"mean_token_accuracy": 0.6812136247754097,
"num_tokens": 10009540.0,
"step": 78
},
{
"entropy": 1.0610005855560303,
"epoch": 1.0,
"grad_norm": 0.3391527831554413,
"learning_rate": 4.011497787155938e-05,
"loss": 1.077329158782959,
"mean_token_accuracy": 0.6696272492408752,
"num_tokens": 10017540.0,
"step": 79
}
],
"logging_steps": 1,
"max_steps": 237,
"num_input_tokens_seen": 0,
"num_train_epochs": 3,
"save_steps": 500,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": false
},
"attributes": {}
}
},
"total_flos": 1.057669943367041e+18,
"train_batch_size": 1,
"trial_name": null,
"trial_params": null
}