checkpoint-65 / trainer_state.json
Jukaboo's picture
Upload 13 files
9dab94b
Raw
History Blame Contribute Delete
8.37 kB
{
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 0.20108275328692962,
"eval_steps": 65,
"global_step": 65,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.0,
"learning_rate": 1.1764705882352942e-05,
"loss": 2.7493,
"step": 1
},
{
"epoch": 0.01,
"learning_rate": 2.3529411764705884e-05,
"loss": 2.6209,
"step": 2
},
{
"epoch": 0.01,
"learning_rate": 3.529411764705883e-05,
"loss": 2.6323,
"step": 3
},
{
"epoch": 0.01,
"learning_rate": 4.705882352941177e-05,
"loss": 2.7371,
"step": 4
},
{
"epoch": 0.02,
"learning_rate": 5.882352941176471e-05,
"loss": 2.7399,
"step": 5
},
{
"epoch": 0.02,
"learning_rate": 7.058823529411765e-05,
"loss": 2.6775,
"step": 6
},
{
"epoch": 0.02,
"learning_rate": 8.23529411764706e-05,
"loss": 2.6392,
"step": 7
},
{
"epoch": 0.02,
"learning_rate": 9.411764705882353e-05,
"loss": 2.6636,
"step": 8
},
{
"epoch": 0.03,
"learning_rate": 0.00010588235294117647,
"loss": 2.6269,
"step": 9
},
{
"epoch": 0.03,
"learning_rate": 0.00011764705882352942,
"loss": 2.6557,
"step": 10
},
{
"epoch": 0.03,
"learning_rate": 0.00012941176470588237,
"loss": 2.5117,
"step": 11
},
{
"epoch": 0.04,
"learning_rate": 0.0001411764705882353,
"loss": 2.54,
"step": 12
},
{
"epoch": 0.04,
"learning_rate": 0.00015294117647058822,
"loss": 2.4645,
"step": 13
},
{
"epoch": 0.04,
"learning_rate": 0.0001647058823529412,
"loss": 2.4728,
"step": 14
},
{
"epoch": 0.05,
"learning_rate": 0.00017647058823529413,
"loss": 2.5242,
"step": 15
},
{
"epoch": 0.05,
"learning_rate": 0.00018823529411764707,
"loss": 2.4592,
"step": 16
},
{
"epoch": 0.05,
"learning_rate": 0.0002,
"loss": 2.364,
"step": 17
},
{
"epoch": 0.06,
"learning_rate": 0.00019999472984871732,
"loss": 2.3955,
"step": 18
},
{
"epoch": 0.06,
"learning_rate": 0.00019997891995035912,
"loss": 2.3193,
"step": 19
},
{
"epoch": 0.06,
"learning_rate": 0.0001999525719713366,
"loss": 2.3536,
"step": 20
},
{
"epoch": 0.06,
"learning_rate": 0.0001999156886888064,
"loss": 2.4059,
"step": 21
},
{
"epoch": 0.07,
"learning_rate": 0.00019986827399037812,
"loss": 2.4518,
"step": 22
},
{
"epoch": 0.07,
"learning_rate": 0.00019981033287370443,
"loss": 2.3709,
"step": 23
},
{
"epoch": 0.07,
"learning_rate": 0.00019974187144595432,
"loss": 2.4401,
"step": 24
},
{
"epoch": 0.08,
"learning_rate": 0.00019966289692316944,
"loss": 2.3015,
"step": 25
},
{
"epoch": 0.08,
"learning_rate": 0.00019957341762950344,
"loss": 2.3688,
"step": 26
},
{
"epoch": 0.08,
"learning_rate": 0.00019947344299634464,
"loss": 2.2737,
"step": 27
},
{
"epoch": 0.09,
"learning_rate": 0.00019936298356132176,
"loss": 2.2844,
"step": 28
},
{
"epoch": 0.09,
"learning_rate": 0.0001992420509671936,
"loss": 2.2693,
"step": 29
},
{
"epoch": 0.09,
"learning_rate": 0.00019911065796062135,
"loss": 2.2691,
"step": 30
},
{
"epoch": 0.1,
"learning_rate": 0.00019896881839082556,
"loss": 2.2378,
"step": 31
},
{
"epoch": 0.1,
"learning_rate": 0.00019881654720812594,
"loss": 2.1501,
"step": 32
},
{
"epoch": 0.1,
"learning_rate": 0.00019865386046236596,
"loss": 2.0803,
"step": 33
},
{
"epoch": 0.11,
"learning_rate": 0.00019848077530122083,
"loss": 2.1133,
"step": 34
},
{
"epoch": 0.11,
"learning_rate": 0.0001982973099683902,
"loss": 2.0154,
"step": 35
},
{
"epoch": 0.11,
"learning_rate": 0.00019810348380167527,
"loss": 1.962,
"step": 36
},
{
"epoch": 0.11,
"learning_rate": 0.00019789931723094046,
"loss": 1.9794,
"step": 37
},
{
"epoch": 0.12,
"learning_rate": 0.0001976848317759601,
"loss": 2.017,
"step": 38
},
{
"epoch": 0.12,
"learning_rate": 0.00019746005004415005,
"loss": 1.9816,
"step": 39
},
{
"epoch": 0.12,
"learning_rate": 0.00019722499572818496,
"loss": 1.9713,
"step": 40
},
{
"epoch": 0.13,
"learning_rate": 0.00019697969360350098,
"loss": 1.9338,
"step": 41
},
{
"epoch": 0.13,
"learning_rate": 0.00019672416952568416,
"loss": 1.983,
"step": 42
},
{
"epoch": 0.13,
"learning_rate": 0.00019645845042774553,
"loss": 1.821,
"step": 43
},
{
"epoch": 0.14,
"learning_rate": 0.00019618256431728194,
"loss": 1.9501,
"step": 44
},
{
"epoch": 0.14,
"learning_rate": 0.00019589654027352414,
"loss": 1.9909,
"step": 45
},
{
"epoch": 0.14,
"learning_rate": 0.0001956004084442718,
"loss": 1.8494,
"step": 46
},
{
"epoch": 0.15,
"learning_rate": 0.00019529420004271567,
"loss": 1.8093,
"step": 47
},
{
"epoch": 0.15,
"learning_rate": 0.0001949779473441478,
"loss": 1.7693,
"step": 48
},
{
"epoch": 0.15,
"learning_rate": 0.00019465168368255946,
"loss": 1.7823,
"step": 49
},
{
"epoch": 0.15,
"learning_rate": 0.00019431544344712776,
"loss": 1.7239,
"step": 50
},
{
"epoch": 0.16,
"learning_rate": 0.00019396926207859084,
"loss": 2.2562,
"step": 51
},
{
"epoch": 0.16,
"learning_rate": 0.00019361317606551238,
"loss": 2.201,
"step": 52
},
{
"epoch": 0.16,
"learning_rate": 0.00019324722294043558,
"loss": 2.2162,
"step": 53
},
{
"epoch": 0.17,
"learning_rate": 0.00019287144127592704,
"loss": 2.2388,
"step": 54
},
{
"epoch": 0.17,
"learning_rate": 0.0001924858706805112,
"loss": 2.2686,
"step": 55
},
{
"epoch": 0.17,
"learning_rate": 0.0001920905517944954,
"loss": 2.213,
"step": 56
},
{
"epoch": 0.18,
"learning_rate": 0.00019168552628568631,
"loss": 2.1732,
"step": 57
},
{
"epoch": 0.18,
"learning_rate": 0.00019127083684499806,
"loss": 2.2206,
"step": 58
},
{
"epoch": 0.18,
"learning_rate": 0.00019084652718195238,
"loss": 2.0658,
"step": 59
},
{
"epoch": 0.19,
"learning_rate": 0.0001904126420200716,
"loss": 2.1432,
"step": 60
},
{
"epoch": 0.19,
"learning_rate": 0.00018996922709216455,
"loss": 2.0427,
"step": 61
},
{
"epoch": 0.19,
"learning_rate": 0.00018951632913550626,
"loss": 2.1674,
"step": 62
},
{
"epoch": 0.19,
"learning_rate": 0.00018905399588691163,
"loss": 2.1218,
"step": 63
},
{
"epoch": 0.2,
"learning_rate": 0.00018858227607770398,
"loss": 2.1721,
"step": 64
},
{
"epoch": 0.2,
"learning_rate": 0.00018810121942857845,
"loss": 2.1525,
"step": 65
},
{
"epoch": 0.2,
"eval_loss": 2.053250789642334,
"eval_runtime": 25.1667,
"eval_samples_per_second": 3.457,
"eval_steps_per_second": 0.437,
"step": 65
}
],
"logging_steps": 1,
"max_steps": 323,
"num_train_epochs": 1,
"save_steps": 65,
"total_flos": 3.793060461625344e+16,
"trial_name": null,
"trial_params": null
}