xlm-roberta-large-massive-lora / ru-RU /trainer_state.json
Erland's picture
Add ru-RU (haryos_model_loras_large)
c08a70c verified
Raw
History Blame Contribute Delete
9.33 kB
{
"best_global_step": 1800,
"best_metric": 0.8691588785046729,
"best_model_checkpoint": "haryos_model_loras_large/xlm-roberta-large_massive_lora_ru-RU/checkpoint-1800",
"epoch": 5.0,
"eval_steps": 500,
"global_step": 1800,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.1388888888888889,
"grad_norm": 3.6620867252349854,
"learning_rate": 0.00019455555555555556,
"loss": 3.822177734375,
"step": 50
},
{
"epoch": 0.2777777777777778,
"grad_norm": 7.815118789672852,
"learning_rate": 0.00018899999999999999,
"loss": 3.00836181640625,
"step": 100
},
{
"epoch": 0.4166666666666667,
"grad_norm": 7.057448387145996,
"learning_rate": 0.00018344444444444446,
"loss": 1.7329855346679688,
"step": 150
},
{
"epoch": 0.5555555555555556,
"grad_norm": 5.466603755950928,
"learning_rate": 0.00017788888888888892,
"loss": 1.2191082000732423,
"step": 200
},
{
"epoch": 0.6944444444444444,
"grad_norm": 4.801546573638916,
"learning_rate": 0.00017233333333333334,
"loss": 1.0881301879882812,
"step": 250
},
{
"epoch": 0.8333333333333334,
"grad_norm": 4.551077842712402,
"learning_rate": 0.0001667777777777778,
"loss": 0.9190669250488281,
"step": 300
},
{
"epoch": 0.9722222222222222,
"grad_norm": 13.638528823852539,
"learning_rate": 0.00016122222222222224,
"loss": 0.755425033569336,
"step": 350
},
{
"epoch": 1.0,
"eval_accuracy": 0.8052139695031972,
"eval_f1": 0.7951606942706597,
"eval_loss": 0.6754380464553833,
"eval_runtime": 1.7908,
"eval_samples_per_second": 1135.245,
"eval_steps_per_second": 17.869,
"step": 360
},
{
"epoch": 1.1111111111111112,
"grad_norm": 6.151719570159912,
"learning_rate": 0.00015566666666666666,
"loss": 0.7096215057373046,
"step": 400
},
{
"epoch": 1.25,
"grad_norm": 5.832527160644531,
"learning_rate": 0.00015011111111111112,
"loss": 0.6258441543579102,
"step": 450
},
{
"epoch": 1.3888888888888888,
"grad_norm": 3.742814540863037,
"learning_rate": 0.00014455555555555557,
"loss": 0.663236312866211,
"step": 500
},
{
"epoch": 1.5277777777777777,
"grad_norm": 4.150186538696289,
"learning_rate": 0.000139,
"loss": 0.6828049468994141,
"step": 550
},
{
"epoch": 1.6666666666666665,
"grad_norm": 3.1718549728393555,
"learning_rate": 0.00013344444444444447,
"loss": 0.6133577728271484,
"step": 600
},
{
"epoch": 1.8055555555555556,
"grad_norm": 4.844176292419434,
"learning_rate": 0.0001278888888888889,
"loss": 0.6224682998657226,
"step": 650
},
{
"epoch": 1.9444444444444444,
"grad_norm": 4.165023326873779,
"learning_rate": 0.00012233333333333334,
"loss": 0.5294166564941406,
"step": 700
},
{
"epoch": 2.0,
"eval_accuracy": 0.8504672897196262,
"eval_f1": 0.8474851881678009,
"eval_loss": 0.5576382279396057,
"eval_runtime": 1.786,
"eval_samples_per_second": 1138.294,
"eval_steps_per_second": 17.917,
"step": 720
},
{
"epoch": 2.0833333333333335,
"grad_norm": 3.8788259029388428,
"learning_rate": 0.00011677777777777778,
"loss": 0.633831787109375,
"step": 750
},
{
"epoch": 2.2222222222222223,
"grad_norm": 6.07531213760376,
"learning_rate": 0.00011122222222222223,
"loss": 0.47904563903808595,
"step": 800
},
{
"epoch": 2.361111111111111,
"grad_norm": 2.9574525356292725,
"learning_rate": 0.00010566666666666667,
"loss": 0.534382095336914,
"step": 850
},
{
"epoch": 2.5,
"grad_norm": 3.9753854274749756,
"learning_rate": 0.0001001111111111111,
"loss": 0.5087989044189453,
"step": 900
},
{
"epoch": 2.638888888888889,
"grad_norm": 5.035774230957031,
"learning_rate": 9.455555555555556e-05,
"loss": 0.4885675048828125,
"step": 950
},
{
"epoch": 2.7777777777777777,
"grad_norm": 6.545742034912109,
"learning_rate": 8.900000000000001e-05,
"loss": 0.5159788131713867,
"step": 1000
},
{
"epoch": 2.9166666666666665,
"grad_norm": 4.568363666534424,
"learning_rate": 8.344444444444445e-05,
"loss": 0.4497852325439453,
"step": 1050
},
{
"epoch": 3.0,
"eval_accuracy": 0.8627643876045253,
"eval_f1": 0.8603424259807203,
"eval_loss": 0.5127748847007751,
"eval_runtime": 1.7832,
"eval_samples_per_second": 1140.056,
"eval_steps_per_second": 17.945,
"step": 1080
},
{
"epoch": 3.0555555555555554,
"grad_norm": 2.7474329471588135,
"learning_rate": 7.788888888888888e-05,
"loss": 0.46715248107910157,
"step": 1100
},
{
"epoch": 3.1944444444444446,
"grad_norm": 4.932474613189697,
"learning_rate": 7.233333333333335e-05,
"loss": 0.42240074157714846,
"step": 1150
},
{
"epoch": 3.3333333333333335,
"grad_norm": 3.918285846710205,
"learning_rate": 6.677777777777779e-05,
"loss": 0.4302996826171875,
"step": 1200
},
{
"epoch": 3.4722222222222223,
"grad_norm": 2.998631715774536,
"learning_rate": 6.122222222222222e-05,
"loss": 0.4148902893066406,
"step": 1250
},
{
"epoch": 3.611111111111111,
"grad_norm": 5.161650657653809,
"learning_rate": 5.566666666666667e-05,
"loss": 0.428927001953125,
"step": 1300
},
{
"epoch": 3.75,
"grad_norm": 3.606273651123047,
"learning_rate": 5.011111111111111e-05,
"loss": 0.4201693344116211,
"step": 1350
},
{
"epoch": 3.888888888888889,
"grad_norm": 4.365043640136719,
"learning_rate": 4.4555555555555555e-05,
"loss": 0.4280767059326172,
"step": 1400
},
{
"epoch": 4.0,
"eval_accuracy": 0.8657156910969012,
"eval_f1": 0.8636310959273443,
"eval_loss": 0.4980275332927704,
"eval_runtime": 1.7858,
"eval_samples_per_second": 1138.44,
"eval_steps_per_second": 17.919,
"step": 1440
},
{
"epoch": 4.027777777777778,
"grad_norm": 3.231497049331665,
"learning_rate": 3.9000000000000006e-05,
"loss": 0.39546192169189454,
"step": 1450
},
{
"epoch": 4.166666666666667,
"grad_norm": 6.7287702560424805,
"learning_rate": 3.3444444444444443e-05,
"loss": 0.372986946105957,
"step": 1500
},
{
"epoch": 4.305555555555555,
"grad_norm": 2.7220969200134277,
"learning_rate": 2.788888888888889e-05,
"loss": 0.34643054962158204,
"step": 1550
},
{
"epoch": 4.444444444444445,
"grad_norm": 1.9666249752044678,
"learning_rate": 2.2333333333333335e-05,
"loss": 0.3881946563720703,
"step": 1600
},
{
"epoch": 4.583333333333333,
"grad_norm": 4.047429084777832,
"learning_rate": 1.677777777777778e-05,
"loss": 0.37857887268066404,
"step": 1650
},
{
"epoch": 4.722222222222222,
"grad_norm": 4.3982744216918945,
"learning_rate": 1.1222222222222224e-05,
"loss": 0.3813508605957031,
"step": 1700
},
{
"epoch": 4.861111111111111,
"grad_norm": 2.6614363193511963,
"learning_rate": 5.666666666666667e-06,
"loss": 0.37185771942138673,
"step": 1750
},
{
"epoch": 5.0,
"grad_norm": 2.6081504821777344,
"learning_rate": 1.1111111111111112e-07,
"loss": 0.3751992416381836,
"step": 1800
},
{
"epoch": 5.0,
"eval_accuracy": 0.8691588785046729,
"eval_f1": 0.8679303391344835,
"eval_loss": 0.4859911799430847,
"eval_runtime": 1.7905,
"eval_samples_per_second": 1135.431,
"eval_steps_per_second": 17.872,
"step": 1800
},
{
"epoch": 5.0,
"step": 1800,
"total_flos": 1.353411879487488e+16,
"train_loss": 0.7395658906300863,
"train_runtime": 140.5322,
"train_samples_per_second": 409.657,
"train_steps_per_second": 12.808
}
],
"logging_steps": 50,
"max_steps": 1800,
"num_input_tokens_seen": 0,
"num_train_epochs": 5,
"save_steps": 500,
"stateful_callbacks": {
"EarlyStoppingCallback": {
"args": {
"early_stopping_patience": 3,
"early_stopping_threshold": 0.0
},
"attributes": {
"early_stopping_patience_counter": 0
}
},
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": true
},
"attributes": {}
}
},
"total_flos": 1.353411879487488e+16,
"train_batch_size": 32,
"trial_name": null,
"trial_params": null
}