PEFT
Safetensors
pa_baseline / trainer_state.json
elfrjop's picture
Upload folder using huggingface_hub
4252bf3 verified
Raw
History Blame Contribute Delete
10.3 kB
{
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 1.0,
"eval_steps": 500,
"global_step": 625,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.016,
"grad_norm": 0.0,
"learning_rate": 7.936507936507936e-06,
"loss": 0.103,
"step": 10
},
{
"epoch": 0.032,
"grad_norm": 0.24380330741405487,
"learning_rate": 1.5873015873015872e-05,
"loss": 0.1262,
"step": 20
},
{
"epoch": 0.048,
"grad_norm": 0.1586637645959854,
"learning_rate": 2.380952380952381e-05,
"loss": 0.2298,
"step": 30
},
{
"epoch": 0.064,
"grad_norm": 0.282357394695282,
"learning_rate": 3.1746031746031745e-05,
"loss": 0.1866,
"step": 40
},
{
"epoch": 0.08,
"grad_norm": 0.23044410347938538,
"learning_rate": 3.968253968253968e-05,
"loss": 0.2232,
"step": 50
},
{
"epoch": 0.096,
"grad_norm": 0.0,
"learning_rate": 4.761904761904762e-05,
"loss": 0.1182,
"step": 60
},
{
"epoch": 0.112,
"grad_norm": 0.0,
"learning_rate": 4.9980862826611875e-05,
"loss": 0.1124,
"step": 70
},
{
"epoch": 0.128,
"grad_norm": 0.37043747305870056,
"learning_rate": 4.988720025682995e-05,
"loss": 0.083,
"step": 80
},
{
"epoch": 0.144,
"grad_norm": 0.0,
"learning_rate": 4.971578953735912e-05,
"loss": 0.0396,
"step": 90
},
{
"epoch": 0.16,
"grad_norm": 0.19477824866771698,
"learning_rate": 4.946716615897932e-05,
"loss": 0.0685,
"step": 100
},
{
"epoch": 0.176,
"grad_norm": 0.0,
"learning_rate": 4.9142106826480114e-05,
"loss": 0.0525,
"step": 110
},
{
"epoch": 0.192,
"grad_norm": 0.20189929008483887,
"learning_rate": 4.874162703221823e-05,
"loss": 0.0684,
"step": 120
},
{
"epoch": 0.208,
"grad_norm": 0.2944314181804657,
"learning_rate": 4.8266977883697515e-05,
"loss": 0.0693,
"step": 130
},
{
"epoch": 0.224,
"grad_norm": 0.0,
"learning_rate": 4.771964219508222e-05,
"loss": 0.0621,
"step": 140
},
{
"epoch": 0.24,
"grad_norm": 0.0,
"learning_rate": 4.710132985485355e-05,
"loss": 0.0185,
"step": 150
},
{
"epoch": 0.256,
"grad_norm": 0.0,
"learning_rate": 4.6413972484081216e-05,
"loss": 0.0492,
"step": 160
},
{
"epoch": 0.272,
"grad_norm": 0.18733273446559906,
"learning_rate": 4.5659717401997655e-05,
"loss": 0.0541,
"step": 170
},
{
"epoch": 0.288,
"grad_norm": 0.0,
"learning_rate": 4.4840920917726426e-05,
"loss": 0.0409,
"step": 180
},
{
"epoch": 0.304,
"grad_norm": 0.16774742305278778,
"learning_rate": 4.396014096912182e-05,
"loss": 0.0752,
"step": 190
},
{
"epoch": 0.32,
"grad_norm": 0.2138904631137848,
"learning_rate": 4.302012913171584e-05,
"loss": 0.0634,
"step": 200
},
{
"epoch": 0.336,
"grad_norm": 0.16526997089385986,
"learning_rate": 4.2023822022737016e-05,
"loss": 0.0814,
"step": 210
},
{
"epoch": 0.352,
"grad_norm": 0.0,
"learning_rate": 4.0974332127054914e-05,
"loss": 0.0329,
"step": 220
},
{
"epoch": 0.368,
"grad_norm": 0.19396360218524933,
"learning_rate": 3.9874938073710336e-05,
"loss": 0.0575,
"step": 230
},
{
"epoch": 0.384,
"grad_norm": 0.16870930790901184,
"learning_rate": 3.872907439340758e-05,
"loss": 0.0532,
"step": 240
},
{
"epoch": 0.4,
"grad_norm": 0.18818065524101257,
"learning_rate": 3.75403207889666e-05,
"loss": 0.0422,
"step": 250
},
{
"epoch": 0.416,
"grad_norm": 0.2430911660194397,
"learning_rate": 3.631239095225417e-05,
"loss": 0.0733,
"step": 260
},
{
"epoch": 0.432,
"grad_norm": 0.17143367230892181,
"learning_rate": 3.504912096253061e-05,
"loss": 0.059,
"step": 270
},
{
"epoch": 0.448,
"grad_norm": 0.19384104013442993,
"learning_rate": 3.375445730245546e-05,
"loss": 0.0717,
"step": 280
},
{
"epoch": 0.464,
"grad_norm": 0.0,
"learning_rate": 3.243244452919072e-05,
"loss": 0.0457,
"step": 290
},
{
"epoch": 0.48,
"grad_norm": 0.2219766527414322,
"learning_rate": 3.108721263911706e-05,
"loss": 0.0607,
"step": 300
},
{
"epoch": 0.496,
"grad_norm": 0.0,
"learning_rate": 2.9722964165636264e-05,
"loss": 0.062,
"step": 310
},
{
"epoch": 0.512,
"grad_norm": 0.2979666292667389,
"learning_rate": 2.8343961050366275e-05,
"loss": 0.0567,
"step": 320
},
{
"epoch": 0.528,
"grad_norm": 0.2317102998495102,
"learning_rate": 2.695451132874385e-05,
"loss": 0.0493,
"step": 330
},
{
"epoch": 0.544,
"grad_norm": 0.255515992641449,
"learning_rate": 2.5558955671628965e-05,
"loss": 0.029,
"step": 340
},
{
"epoch": 0.56,
"grad_norm": 0.25291353464126587,
"learning_rate": 2.416165382495565e-05,
"loss": 0.0612,
"step": 350
},
{
"epoch": 0.576,
"grad_norm": 0.0,
"learning_rate": 2.2766970989791696e-05,
"loss": 0.0281,
"step": 360
},
{
"epoch": 0.592,
"grad_norm": 0.0,
"learning_rate": 2.1379264185356544e-05,
"loss": 0.0261,
"step": 370
},
{
"epoch": 0.608,
"grad_norm": 0.3032894432544708,
"learning_rate": 2.000286863759934e-05,
"loss": 0.034,
"step": 380
},
{
"epoch": 0.624,
"grad_norm": 0.27459245920181274,
"learning_rate": 1.8642084235859765e-05,
"loss": 0.0536,
"step": 390
},
{
"epoch": 0.64,
"grad_norm": 0.0,
"learning_rate": 1.7301162099921013e-05,
"loss": 0.0276,
"step": 400
},
{
"epoch": 0.656,
"grad_norm": 0.0,
"learning_rate": 1.5984291299420117e-05,
"loss": 0.0536,
"step": 410
},
{
"epoch": 0.672,
"grad_norm": 0.0,
"learning_rate": 1.4695585767104092e-05,
"loss": 0.039,
"step": 420
},
{
"epoch": 0.688,
"grad_norm": 0.0,
"learning_rate": 1.3439071446815452e-05,
"loss": 0.0548,
"step": 430
},
{
"epoch": 0.704,
"grad_norm": 0.18401296436786652,
"learning_rate": 1.2218673716356919e-05,
"loss": 0.0259,
"step": 440
},
{
"epoch": 0.72,
"grad_norm": 0.0,
"learning_rate": 1.103820512452661e-05,
"loss": 0.0562,
"step": 450
},
{
"epoch": 0.736,
"grad_norm": 0.27832138538360596,
"learning_rate": 9.901353480633468e-06,
"loss": 0.0784,
"step": 460
},
{
"epoch": 0.752,
"grad_norm": 0.3106365203857422,
"learning_rate": 8.811670333701544e-06,
"loss": 0.0416,
"step": 470
},
{
"epoch": 0.768,
"grad_norm": 0.0,
"learning_rate": 7.77255987735434e-06,
"loss": 0.0327,
"step": 480
},
{
"epoch": 0.784,
"grad_norm": 0.19409137964248657,
"learning_rate": 6.787268315040604e-06,
"loss": 0.0695,
"step": 490
},
{
"epoch": 0.8,
"grad_norm": 0.0,
"learning_rate": 5.8588737188248285e-06,
"loss": 0.0474,
"step": 500
},
{
"epoch": 0.816,
"grad_norm": 0.0,
"learning_rate": 4.9902764134238165e-06,
"loss": 0.0434,
"step": 510
},
{
"epoch": 0.832,
"grad_norm": 0.22170156240463257,
"learning_rate": 4.184189915529796e-06,
"loss": 0.0694,
"step": 520
},
{
"epoch": 0.848,
"grad_norm": 0.3862822651863098,
"learning_rate": 3.443132456725817e-06,
"loss": 0.0396,
"step": 530
},
{
"epoch": 0.864,
"grad_norm": 0.0,
"learning_rate": 2.769419116476052e-06,
"loss": 0.0484,
"step": 540
},
{
"epoch": 0.88,
"grad_norm": 0.0,
"learning_rate": 2.165154589767651e-06,
"loss": 0.0598,
"step": 550
},
{
"epoch": 0.896,
"grad_norm": 0.24787913262844086,
"learning_rate": 1.632226611998322e-06,
"loss": 0.0469,
"step": 560
},
{
"epoch": 0.912,
"grad_norm": 0.0,
"learning_rate": 1.1723000616502167e-06,
"loss": 0.0464,
"step": 570
},
{
"epoch": 0.928,
"grad_norm": 0.0,
"learning_rate": 7.868117591737583e-07,
"loss": 0.0571,
"step": 580
},
{
"epoch": 0.944,
"grad_norm": 0.2985147535800934,
"learning_rate": 4.769659783295383e-07,
"loss": 0.0645,
"step": 590
},
{
"epoch": 0.96,
"grad_norm": 0.0,
"learning_rate": 2.4373068401120356e-07,
"loss": 0.0473,
"step": 600
},
{
"epoch": 0.976,
"grad_norm": 0.1989932507276535,
"learning_rate": 8.783450830224249e-08,
"loss": 0.0658,
"step": 610
},
{
"epoch": 0.992,
"grad_norm": 0.25899210572242737,
"learning_rate": 9.764474213677654e-09,
"loss": 0.0438,
"step": 620
}
],
"logging_steps": 10,
"max_steps": 625,
"num_input_tokens_seen": 0,
"num_train_epochs": 1,
"save_steps": 1000,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": true
},
"attributes": {}
}
},
"total_flos": 7.713640389083136e+16,
"train_batch_size": 16,
"trial_name": null,
"trial_params": null
}