SFT-Qwen3-4B / trainer_state.json
Xerrex-6's picture
Upload folder using huggingface_hub
fdae122 verified
Raw
History Blame Contribute Delete
15.8 kB
{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 3.0,
"eval_steps": 20,
"global_step": 513,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.05865102639296188,
"grad_norm": 0.2199089378118515,
"learning_rate": 9.992407582166581e-05,
"loss": 2.171413612365723,
"step": 10
},
{
"epoch": 0.11730205278592376,
"grad_norm": 0.18916942179203033,
"learning_rate": 9.966191788709716e-05,
"loss": 1.8421794891357421,
"step": 20
},
{
"epoch": 0.11730205278592376,
"eval_loss": 1.7743369340896606,
"eval_runtime": 61.8903,
"eval_samples_per_second": 39.263,
"eval_steps_per_second": 0.42,
"step": 20
},
{
"epoch": 0.17595307917888564,
"grad_norm": 0.12417227029800415,
"learning_rate": 9.921357148779606e-05,
"loss": 1.7548107147216796,
"step": 30
},
{
"epoch": 0.23460410557184752,
"grad_norm": 0.0854392722249031,
"learning_rate": 9.85807175279907e-05,
"loss": 1.7152568817138671,
"step": 40
},
{
"epoch": 0.23460410557184752,
"eval_loss": 1.6997339725494385,
"eval_runtime": 50.7944,
"eval_samples_per_second": 47.84,
"eval_steps_per_second": 0.512,
"step": 40
},
{
"epoch": 0.2932551319648094,
"grad_norm": 0.07562987506389618,
"learning_rate": 9.776572865280207e-05,
"loss": 1.6737960815429687,
"step": 50
},
{
"epoch": 0.3519061583577713,
"grad_norm": 0.07606321573257446,
"learning_rate": 9.677166035291405e-05,
"loss": 1.6580020904541015,
"step": 60
},
{
"epoch": 0.3519061583577713,
"eval_loss": 1.6625698804855347,
"eval_runtime": 50.7016,
"eval_samples_per_second": 47.928,
"eval_steps_per_second": 0.513,
"step": 60
},
{
"epoch": 0.41055718475073316,
"grad_norm": 0.07690507918596268,
"learning_rate": 9.560223950917353e-05,
"loss": 1.658456802368164,
"step": 70
},
{
"epoch": 0.46920821114369504,
"grad_norm": 0.08297807723283768,
"learning_rate": 9.42618504200689e-05,
"loss": 1.6370161056518555,
"step": 80
},
{
"epoch": 0.46920821114369504,
"eval_loss": 1.6375877857208252,
"eval_runtime": 50.7877,
"eval_samples_per_second": 47.846,
"eval_steps_per_second": 0.512,
"step": 80
},
{
"epoch": 0.5278592375366569,
"grad_norm": 0.09066126495599747,
"learning_rate": 9.275551836447103e-05,
"loss": 1.639760971069336,
"step": 90
},
{
"epoch": 0.5865102639296188,
"grad_norm": 0.08974612504243851,
"learning_rate": 9.108889076126226e-05,
"loss": 1.6200483322143555,
"step": 100
},
{
"epoch": 0.5865102639296188,
"eval_loss": 1.6185985803604126,
"eval_runtime": 50.8043,
"eval_samples_per_second": 47.831,
"eval_steps_per_second": 0.512,
"step": 100
},
{
"epoch": 0.6451612903225806,
"grad_norm": 0.0942302867770195,
"learning_rate": 8.926821599648816e-05,
"loss": 1.6054956436157226,
"step": 110
},
{
"epoch": 0.7038123167155426,
"grad_norm": 0.10261812061071396,
"learning_rate": 8.730031999741158e-05,
"loss": 1.6100627899169921,
"step": 120
},
{
"epoch": 0.7038123167155426,
"eval_loss": 1.6033717393875122,
"eval_runtime": 50.7978,
"eval_samples_per_second": 47.837,
"eval_steps_per_second": 0.512,
"step": 120
},
{
"epoch": 0.7624633431085044,
"grad_norm": 0.1043047085404396,
"learning_rate": 8.519258064129558e-05,
"loss": 1.6290523529052734,
"step": 130
},
{
"epoch": 0.8211143695014663,
"grad_norm": 0.11067894846200943,
"learning_rate": 8.295290009486006e-05,
"loss": 1.5792938232421876,
"step": 140
},
{
"epoch": 0.8211143695014663,
"eval_loss": 1.5912233591079712,
"eval_runtime": 50.855,
"eval_samples_per_second": 47.783,
"eval_steps_per_second": 0.511,
"step": 140
},
{
"epoch": 0.8797653958944281,
"grad_norm": 0.10661020874977112,
"learning_rate": 8.058967518811425e-05,
"loss": 1.5838823318481445,
"step": 150
},
{
"epoch": 0.9384164222873901,
"grad_norm": 0.12469790130853653,
"learning_rate": 7.811176593363772e-05,
"loss": 1.5862667083740234,
"step": 160
},
{
"epoch": 0.9384164222873901,
"eval_loss": 1.5811413526535034,
"eval_runtime": 50.8651,
"eval_samples_per_second": 47.773,
"eval_steps_per_second": 0.511,
"step": 160
},
{
"epoch": 0.9970674486803519,
"grad_norm": 0.125987708568573,
"learning_rate": 7.552846230933437e-05,
"loss": 1.5710247039794922,
"step": 170
},
{
"epoch": 1.0527859237536656,
"grad_norm": 0.12022332847118378,
"learning_rate": 7.284944942919519e-05,
"loss": 1.5837053298950194,
"step": 180
},
{
"epoch": 1.0527859237536656,
"eval_loss": 1.573178768157959,
"eval_runtime": 50.8352,
"eval_samples_per_second": 47.802,
"eval_steps_per_second": 0.511,
"step": 180
},
{
"epoch": 1.1114369501466275,
"grad_norm": 0.13042506575584412,
"learning_rate": 7.008477123264848e-05,
"loss": 1.5391403198242188,
"step": 190
},
{
"epoch": 1.1700879765395895,
"grad_norm": 0.12966230511665344,
"learning_rate": 6.724479282863072e-05,
"loss": 1.5630327224731446,
"step": 200
},
{
"epoch": 1.1700879765395895,
"eval_loss": 1.5658373832702637,
"eval_runtime": 50.7515,
"eval_samples_per_second": 47.88,
"eval_steps_per_second": 0.512,
"step": 200
},
{
"epoch": 1.2287390029325513,
"grad_norm": 0.12177792936563492,
"learning_rate": 6.434016163555452e-05,
"loss": 1.5479339599609374,
"step": 210
},
{
"epoch": 1.2873900293255132,
"grad_norm": 0.1271909475326538,
"learning_rate": 6.138176746286468e-05,
"loss": 1.5333200454711915,
"step": 220
},
{
"epoch": 1.2873900293255132,
"eval_loss": 1.5592361688613892,
"eval_runtime": 50.88,
"eval_samples_per_second": 47.759,
"eval_steps_per_second": 0.511,
"step": 220
},
{
"epoch": 1.3460410557184752,
"grad_norm": 0.13476736843585968,
"learning_rate": 5.838070168384118e-05,
"loss": 1.548457717895508,
"step": 230
},
{
"epoch": 1.404692082111437,
"grad_norm": 0.1285582035779953,
"learning_rate": 5.534821565271542e-05,
"loss": 1.5389267921447753,
"step": 240
},
{
"epoch": 1.404692082111437,
"eval_loss": 1.5531750917434692,
"eval_runtime": 50.7263,
"eval_samples_per_second": 47.904,
"eval_steps_per_second": 0.513,
"step": 240
},
{
"epoch": 1.4633431085043989,
"grad_norm": 0.5709601640701294,
"learning_rate": 5.229567852199859e-05,
"loss": 1.544548225402832,
"step": 250
},
{
"epoch": 1.5219941348973607,
"grad_norm": 0.14010146260261536,
"learning_rate": 4.9234534618170395e-05,
"loss": 1.5372689247131348,
"step": 260
},
{
"epoch": 1.5219941348973607,
"eval_loss": 1.5480340719223022,
"eval_runtime": 50.6848,
"eval_samples_per_second": 47.943,
"eval_steps_per_second": 0.513,
"step": 260
},
{
"epoch": 1.5806451612903225,
"grad_norm": 0.14289264380931854,
"learning_rate": 4.6176260535531395e-05,
"loss": 1.5423521041870116,
"step": 270
},
{
"epoch": 1.6392961876832843,
"grad_norm": 0.13429485261440277,
"learning_rate": 4.3132322109079596e-05,
"loss": 1.5462657928466796,
"step": 280
},
{
"epoch": 1.6392961876832843,
"eval_loss": 1.5433279275894165,
"eval_runtime": 50.7331,
"eval_samples_per_second": 47.898,
"eval_steps_per_second": 0.512,
"step": 280
},
{
"epoch": 1.6979472140762464,
"grad_norm": 0.14501748979091644,
"learning_rate": 4.011413142772484e-05,
"loss": 1.5275556564331054,
"step": 290
},
{
"epoch": 1.7565982404692082,
"grad_norm": 0.13486360013484955,
"learning_rate": 3.713300404900376e-05,
"loss": 1.5159502029418945,
"step": 300
},
{
"epoch": 1.7565982404692082,
"eval_loss": 1.5394600629806519,
"eval_runtime": 50.742,
"eval_samples_per_second": 47.889,
"eval_steps_per_second": 0.512,
"step": 300
},
{
"epoch": 1.8152492668621703,
"grad_norm": 0.1557241827249527,
"learning_rate": 3.420011657570238e-05,
"loss": 1.5319683074951171,
"step": 310
},
{
"epoch": 1.873900293255132,
"grad_norm": 0.14938898384571075,
"learning_rate": 3.132646475343665e-05,
"loss": 1.534824275970459,
"step": 320
},
{
"epoch": 1.873900293255132,
"eval_loss": 1.535933494567871,
"eval_runtime": 50.6698,
"eval_samples_per_second": 47.958,
"eval_steps_per_second": 0.513,
"step": 320
},
{
"epoch": 1.932551319648094,
"grad_norm": 0.14145061373710632,
"learning_rate": 2.8522822246288173e-05,
"loss": 1.5147466659545898,
"step": 330
},
{
"epoch": 1.9912023460410557,
"grad_norm": 0.1560547649860382,
"learning_rate": 2.5799700245050074e-05,
"loss": 1.5312614440917969,
"step": 340
},
{
"epoch": 1.9912023460410557,
"eval_loss": 1.5332497358322144,
"eval_runtime": 50.7774,
"eval_samples_per_second": 47.856,
"eval_steps_per_second": 0.512,
"step": 340
},
{
"epoch": 2.0469208211143695,
"grad_norm": 0.15864278376102448,
"learning_rate": 2.3167308059516678e-05,
"loss": 1.5440088272094727,
"step": 350
},
{
"epoch": 2.1055718475073313,
"grad_norm": 0.14240412414073944,
"learning_rate": 2.063551484256107e-05,
"loss": 1.516731357574463,
"step": 360
},
{
"epoch": 2.1055718475073313,
"eval_loss": 1.5310300588607788,
"eval_runtime": 50.8129,
"eval_samples_per_second": 47.823,
"eval_steps_per_second": 0.512,
"step": 360
},
{
"epoch": 2.164222873900293,
"grad_norm": 0.15173648297786713,
"learning_rate": 1.821381258950161e-05,
"loss": 1.4962255477905273,
"step": 370
},
{
"epoch": 2.222873900293255,
"grad_norm": 0.15619643032550812,
"learning_rate": 1.5911280551477185e-05,
"loss": 1.5161256790161133,
"step": 380
},
{
"epoch": 2.222873900293255,
"eval_loss": 1.5295287370681763,
"eval_runtime": 50.8214,
"eval_samples_per_second": 47.814,
"eval_steps_per_second": 0.512,
"step": 380
},
{
"epoch": 2.281524926686217,
"grad_norm": 0.1521531194448471,
"learning_rate": 1.3736551196249759e-05,
"loss": 1.4899578094482422,
"step": 390
},
{
"epoch": 2.340175953079179,
"grad_norm": 0.15226739645004272,
"learning_rate": 1.1697777844051105e-05,
"loss": 1.5050838470458985,
"step": 400
},
{
"epoch": 2.340175953079179,
"eval_loss": 1.5282557010650635,
"eval_runtime": 50.8187,
"eval_samples_per_second": 47.817,
"eval_steps_per_second": 0.512,
"step": 400
},
{
"epoch": 2.398826979472141,
"grad_norm": 0.14956440031528473,
"learning_rate": 9.802604099810997e-06,
"loss": 1.5099305152893066,
"step": 410
},
{
"epoch": 2.4574780058651027,
"grad_norm": 0.15371431410312653,
"learning_rate": 8.058135196368877e-06,
"loss": 1.4888692855834962,
"step": 420
},
{
"epoch": 2.4574780058651027,
"eval_loss": 1.5272583961486816,
"eval_runtime": 50.6668,
"eval_samples_per_second": 47.96,
"eval_steps_per_second": 0.513,
"step": 420
},
{
"epoch": 2.5161290322580645,
"grad_norm": 0.15528695285320282,
"learning_rate": 6.470911356106885e-06,
"loss": 1.5185343742370605,
"step": 430
},
{
"epoch": 2.5747800586510263,
"grad_norm": 0.16078710556030273,
"learning_rate": 5.046883270874603e-06,
"loss": 1.506414794921875,
"step": 440
},
{
"epoch": 2.5747800586510263,
"eval_loss": 1.5265320539474487,
"eval_runtime": 50.6741,
"eval_samples_per_second": 47.954,
"eval_steps_per_second": 0.513,
"step": 440
},
{
"epoch": 2.633431085043988,
"grad_norm": 0.15603981912136078,
"learning_rate": 3.7913897921341866e-06,
"loss": 1.5100496292114258,
"step": 450
},
{
"epoch": 2.6920821114369504,
"grad_norm": 0.15229907631874084,
"learning_rate": 2.7091379149682685e-06,
"loss": 1.493442916870117,
"step": 460
},
{
"epoch": 2.6920821114369504,
"eval_loss": 1.5261310338974,
"eval_runtime": 50.735,
"eval_samples_per_second": 47.896,
"eval_steps_per_second": 0.512,
"step": 460
},
{
"epoch": 2.7507331378299122,
"grad_norm": 0.15283197164535522,
"learning_rate": 1.8041851309928802e-06,
"loss": 1.4831109046936035,
"step": 470
},
{
"epoch": 2.809384164222874,
"grad_norm": 0.15298782289028168,
"learning_rate": 1.0799242163365419e-06,
"loss": 1.505828285217285,
"step": 480
},
{
"epoch": 2.809384164222874,
"eval_loss": 1.5259722471237183,
"eval_runtime": 50.8213,
"eval_samples_per_second": 47.815,
"eval_steps_per_second": 0.512,
"step": 480
},
{
"epoch": 2.868035190615836,
"grad_norm": 0.1547379195690155,
"learning_rate": 5.390705117171047e-07,
"loss": 1.5249052047729492,
"step": 490
},
{
"epoch": 2.9266862170087977,
"grad_norm": 0.14859049022197723,
"learning_rate": 1.8365174230492998e-07,
"loss": 1.497894287109375,
"step": 500
},
{
"epoch": 2.9266862170087977,
"eval_loss": 1.5259029865264893,
"eval_runtime": 50.8143,
"eval_samples_per_second": 47.821,
"eval_steps_per_second": 0.512,
"step": 500
},
{
"epoch": 2.9853372434017595,
"grad_norm": 0.16615204513072968,
"learning_rate": 1.5000415538901636e-08,
"loss": 1.4946805953979492,
"step": 510
},
{
"epoch": 3.0,
"eval_loss": 1.525899887084961,
"eval_runtime": 50.8318,
"eval_samples_per_second": 47.805,
"eval_steps_per_second": 0.511,
"step": 513
}
],
"logging_steps": 10,
"max_steps": 513,
"num_input_tokens_seen": 0,
"num_train_epochs": 3,
"save_steps": 250,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": true
},
"attributes": {}
}
},
"total_flos": 1.7660971754916413e+18,
"train_batch_size": 8,
"trial_name": null,
"trial_params": null
}