PEFT
Safetensors
base-ft / trainer_state.json
deu05232's picture
Upload folder using huggingface_hub
8145b1f verified
Raw
History Blame Contribute Delete
13.2 kB
{
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 1.0,
"eval_steps": 500,
"global_step": 728,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.013736263736263736,
"grad_norm": 5.281684715615811,
"learning_rate": 4.9999999999999996e-05,
"loss": 7.8187,
"step": 10
},
{
"epoch": 0.027472527472527472,
"grad_norm": 24.68054565360157,
"learning_rate": 6.505149978319905e-05,
"loss": 7.9281,
"step": 20
},
{
"epoch": 0.04120879120879121,
"grad_norm": 3.0796940998366895,
"learning_rate": 7.385606273598311e-05,
"loss": 7.7094,
"step": 30
},
{
"epoch": 0.054945054945054944,
"grad_norm": 8.333067476952397,
"learning_rate": 8.01029995663981e-05,
"loss": 7.525,
"step": 40
},
{
"epoch": 0.06868131868131869,
"grad_norm": 23.086614801718486,
"learning_rate": 8.494850021680092e-05,
"loss": 6.9094,
"step": 50
},
{
"epoch": 0.08241758241758242,
"grad_norm": 14.213944887373065,
"learning_rate": 8.890756251918216e-05,
"loss": 4.1141,
"step": 60
},
{
"epoch": 0.09615384615384616,
"grad_norm": 0.8580927887161656,
"learning_rate": 9.225490200071284e-05,
"loss": 2.0804,
"step": 70
},
{
"epoch": 0.10989010989010989,
"grad_norm": 0.27570449858382007,
"learning_rate": 9.515449934959716e-05,
"loss": 0.0238,
"step": 80
},
{
"epoch": 0.12362637362637363,
"grad_norm": 5.11450425512202,
"learning_rate": 9.771212547196623e-05,
"loss": 1.7693,
"step": 90
},
{
"epoch": 0.13736263736263737,
"grad_norm": 3.0188904083540513,
"learning_rate": 9.999999999999999e-05,
"loss": 3.0328,
"step": 100
},
{
"epoch": 0.1510989010989011,
"grad_norm": 2.223466986052455,
"learning_rate": 9.856687898089173e-05,
"loss": 2.5187,
"step": 110
},
{
"epoch": 0.16483516483516483,
"grad_norm": 0.5958810459345905,
"learning_rate": 9.697452229299363e-05,
"loss": 1.7121,
"step": 120
},
{
"epoch": 0.17857142857142858,
"grad_norm": 0.9017097274049742,
"learning_rate": 9.538216560509554e-05,
"loss": 0.2382,
"step": 130
},
{
"epoch": 0.19230769230769232,
"grad_norm": 2.5797266213086973,
"learning_rate": 9.378980891719745e-05,
"loss": 0.96,
"step": 140
},
{
"epoch": 0.20604395604395603,
"grad_norm": 1.969151910347761,
"learning_rate": 9.219745222929936e-05,
"loss": 0.8195,
"step": 150
},
{
"epoch": 0.21978021978021978,
"grad_norm": 1.2964360872016674,
"learning_rate": 9.060509554140128e-05,
"loss": 0.667,
"step": 160
},
{
"epoch": 0.23351648351648352,
"grad_norm": 0.8334871882607511,
"learning_rate": 8.901273885350318e-05,
"loss": 0.7125,
"step": 170
},
{
"epoch": 0.24725274725274726,
"grad_norm": 1.9433127558301508,
"learning_rate": 8.74203821656051e-05,
"loss": 0.8777,
"step": 180
},
{
"epoch": 0.260989010989011,
"grad_norm": 2.888762859831557,
"learning_rate": 8.582802547770701e-05,
"loss": 1.3746,
"step": 190
},
{
"epoch": 0.27472527472527475,
"grad_norm": 2.218013297748846,
"learning_rate": 8.423566878980892e-05,
"loss": 1.5352,
"step": 200
},
{
"epoch": 0.28846153846153844,
"grad_norm": 2.43550275477957,
"learning_rate": 8.264331210191083e-05,
"loss": 1.4766,
"step": 210
},
{
"epoch": 0.3021978021978022,
"grad_norm": 2.793254213699652,
"learning_rate": 8.105095541401275e-05,
"loss": 1.4922,
"step": 220
},
{
"epoch": 0.3159340659340659,
"grad_norm": 2.3770618942858417,
"learning_rate": 7.945859872611465e-05,
"loss": 1.117,
"step": 230
},
{
"epoch": 0.32967032967032966,
"grad_norm": 0.2336001430095062,
"learning_rate": 7.786624203821657e-05,
"loss": 0.1422,
"step": 240
},
{
"epoch": 0.3434065934065934,
"grad_norm": 0.22856765073027144,
"learning_rate": 7.627388535031847e-05,
"loss": 0.0117,
"step": 250
},
{
"epoch": 0.35714285714285715,
"grad_norm": 0.060125491997171404,
"learning_rate": 7.468152866242038e-05,
"loss": 0.0054,
"step": 260
},
{
"epoch": 0.3708791208791209,
"grad_norm": 0.17072233100687323,
"learning_rate": 7.30891719745223e-05,
"loss": 0.007,
"step": 270
},
{
"epoch": 0.38461538461538464,
"grad_norm": 0.2527260405826915,
"learning_rate": 7.14968152866242e-05,
"loss": 0.008,
"step": 280
},
{
"epoch": 0.3983516483516483,
"grad_norm": 0.0645728697451073,
"learning_rate": 6.990445859872612e-05,
"loss": 0.0052,
"step": 290
},
{
"epoch": 0.41208791208791207,
"grad_norm": 0.21741744460459944,
"learning_rate": 6.831210191082804e-05,
"loss": 0.0036,
"step": 300
},
{
"epoch": 0.4258241758241758,
"grad_norm": 0.08947991234943435,
"learning_rate": 6.671974522292994e-05,
"loss": 0.0061,
"step": 310
},
{
"epoch": 0.43956043956043955,
"grad_norm": 0.18230980143975276,
"learning_rate": 6.512738853503185e-05,
"loss": 0.0031,
"step": 320
},
{
"epoch": 0.4532967032967033,
"grad_norm": 0.22933179008937474,
"learning_rate": 6.353503184713377e-05,
"loss": 0.0044,
"step": 330
},
{
"epoch": 0.46703296703296704,
"grad_norm": 0.04926832002954577,
"learning_rate": 6.194267515923567e-05,
"loss": 0.0076,
"step": 340
},
{
"epoch": 0.4807692307692308,
"grad_norm": 0.04172402454517282,
"learning_rate": 6.035031847133759e-05,
"loss": 0.0034,
"step": 350
},
{
"epoch": 0.4945054945054945,
"grad_norm": 0.16913923259852043,
"learning_rate": 5.87579617834395e-05,
"loss": 0.0035,
"step": 360
},
{
"epoch": 0.5082417582417582,
"grad_norm": 0.11774220375908637,
"learning_rate": 5.716560509554141e-05,
"loss": 0.0033,
"step": 370
},
{
"epoch": 0.521978021978022,
"grad_norm": 0.13292673922854645,
"learning_rate": 5.5573248407643317e-05,
"loss": 0.005,
"step": 380
},
{
"epoch": 0.5357142857142857,
"grad_norm": 0.01815243505852036,
"learning_rate": 5.398089171974523e-05,
"loss": 0.0026,
"step": 390
},
{
"epoch": 0.5494505494505495,
"grad_norm": 0.04011699411855183,
"learning_rate": 5.238853503184714e-05,
"loss": 0.0027,
"step": 400
},
{
"epoch": 0.5631868131868132,
"grad_norm": 0.2759252165955475,
"learning_rate": 5.079617834394905e-05,
"loss": 0.0048,
"step": 410
},
{
"epoch": 0.5769230769230769,
"grad_norm": 0.05014856149469786,
"learning_rate": 4.920382165605096e-05,
"loss": 0.0039,
"step": 420
},
{
"epoch": 0.5906593406593407,
"grad_norm": 0.27617966134680133,
"learning_rate": 4.761146496815287e-05,
"loss": 0.0027,
"step": 430
},
{
"epoch": 0.6043956043956044,
"grad_norm": 0.19749811245827784,
"learning_rate": 4.601910828025478e-05,
"loss": 0.005,
"step": 440
},
{
"epoch": 0.6181318681318682,
"grad_norm": 0.02810687835594959,
"learning_rate": 4.442675159235669e-05,
"loss": 0.0022,
"step": 450
},
{
"epoch": 0.6318681318681318,
"grad_norm": 0.1919088763262812,
"learning_rate": 4.2834394904458604e-05,
"loss": 0.005,
"step": 460
},
{
"epoch": 0.6456043956043956,
"grad_norm": 0.07067931858229538,
"learning_rate": 4.1242038216560514e-05,
"loss": 0.0024,
"step": 470
},
{
"epoch": 0.6593406593406593,
"grad_norm": 0.14975480118292797,
"learning_rate": 3.964968152866242e-05,
"loss": 0.003,
"step": 480
},
{
"epoch": 0.6730769230769231,
"grad_norm": 0.1893501746088407,
"learning_rate": 3.805732484076434e-05,
"loss": 0.0041,
"step": 490
},
{
"epoch": 0.6868131868131868,
"grad_norm": 0.014297215049724657,
"learning_rate": 3.646496815286624e-05,
"loss": 0.0044,
"step": 500
},
{
"epoch": 0.7005494505494505,
"grad_norm": 0.16316667250692118,
"learning_rate": 3.487261146496815e-05,
"loss": 0.005,
"step": 510
},
{
"epoch": 0.7142857142857143,
"grad_norm": 0.037938192498763186,
"learning_rate": 3.328025477707007e-05,
"loss": 0.0037,
"step": 520
},
{
"epoch": 0.728021978021978,
"grad_norm": 0.08492737645910046,
"learning_rate": 3.1687898089171976e-05,
"loss": 0.0022,
"step": 530
},
{
"epoch": 0.7417582417582418,
"grad_norm": 0.06111601739850969,
"learning_rate": 3.0095541401273885e-05,
"loss": 0.0025,
"step": 540
},
{
"epoch": 0.7554945054945055,
"grad_norm": 0.019848217192186213,
"learning_rate": 2.8503184713375798e-05,
"loss": 0.0038,
"step": 550
},
{
"epoch": 0.7692307692307693,
"grad_norm": 0.3383546978796607,
"learning_rate": 2.6910828025477707e-05,
"loss": 0.0038,
"step": 560
},
{
"epoch": 0.782967032967033,
"grad_norm": 1.9490031970116397,
"learning_rate": 2.531847133757962e-05,
"loss": 0.2375,
"step": 570
},
{
"epoch": 0.7967032967032966,
"grad_norm": 0.34324620931286737,
"learning_rate": 2.372611464968153e-05,
"loss": 0.4318,
"step": 580
},
{
"epoch": 0.8104395604395604,
"grad_norm": 1.3941788760561156,
"learning_rate": 2.2133757961783442e-05,
"loss": 0.2539,
"step": 590
},
{
"epoch": 0.8241758241758241,
"grad_norm": 2.7410333944585688,
"learning_rate": 2.054140127388535e-05,
"loss": 1.4498,
"step": 600
},
{
"epoch": 0.8379120879120879,
"grad_norm": 1.4457009494440505,
"learning_rate": 1.8949044585987264e-05,
"loss": 1.4875,
"step": 610
},
{
"epoch": 0.8516483516483516,
"grad_norm": 1.3634589208479944,
"learning_rate": 1.7356687898089173e-05,
"loss": 1.6336,
"step": 620
},
{
"epoch": 0.8653846153846154,
"grad_norm": 1.298767831617216,
"learning_rate": 1.5764331210191083e-05,
"loss": 1.4133,
"step": 630
},
{
"epoch": 0.8791208791208791,
"grad_norm": 1.006906042477125,
"learning_rate": 1.4171974522292993e-05,
"loss": 1.4242,
"step": 640
},
{
"epoch": 0.8928571428571429,
"grad_norm": 1.2219253582787113,
"learning_rate": 1.2579617834394904e-05,
"loss": 1.5016,
"step": 650
},
{
"epoch": 0.9065934065934066,
"grad_norm": 2.3238849538833266,
"learning_rate": 1.0987261146496815e-05,
"loss": 1.7574,
"step": 660
},
{
"epoch": 0.9203296703296703,
"grad_norm": 2.398596066971261,
"learning_rate": 9.394904458598726e-06,
"loss": 2.3672,
"step": 670
},
{
"epoch": 0.9340659340659341,
"grad_norm": 2.397067357911802,
"learning_rate": 7.802547770700637e-06,
"loss": 0.7084,
"step": 680
},
{
"epoch": 0.9478021978021978,
"grad_norm": 3.623094463011669,
"learning_rate": 6.210191082802548e-06,
"loss": 1.5625,
"step": 690
},
{
"epoch": 0.9615384615384616,
"grad_norm": 3.023019788637967,
"learning_rate": 4.6178343949044585e-06,
"loss": 1.8281,
"step": 700
},
{
"epoch": 0.9752747252747253,
"grad_norm": 3.21367238289211,
"learning_rate": 3.0254777070063695e-06,
"loss": 1.7805,
"step": 710
},
{
"epoch": 0.989010989010989,
"grad_norm": 1.965949094153684,
"learning_rate": 1.4331210191082802e-06,
"loss": 1.8953,
"step": 720
}
],
"logging_steps": 10,
"max_steps": 728,
"num_input_tokens_seen": 0,
"num_train_epochs": 1,
"save_steps": 100,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": true
},
"attributes": {}
}
},
"total_flos": 0.0,
"train_batch_size": 512,
"trial_name": null,
"trial_params": null
}