dataset_real_4b_det_continue_v6 / trainer_state.json
zbrl's picture
Add files using upload-large-folder tool
ed3cc5c verified
Raw
History Blame Contribute Delete
13.2 kB
{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 5.0,
"eval_steps": 500,
"global_step": 715,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.07017543859649122,
"grad_norm": 11.76454607734096,
"learning_rate": 3.4615384615384617e-06,
"loss": 0.4865,
"step": 10
},
{
"epoch": 0.14035087719298245,
"grad_norm": 14.968705460305152,
"learning_rate": 4.99743403167199e-06,
"loss": 0.359,
"step": 20
},
{
"epoch": 0.21052631578947367,
"grad_norm": 8.988922429392048,
"learning_rate": 4.981772185245135e-06,
"loss": 0.3123,
"step": 30
},
{
"epoch": 0.2807017543859649,
"grad_norm": 7.483069905570552,
"learning_rate": 4.9519632010080765e-06,
"loss": 0.2929,
"step": 40
},
{
"epoch": 0.3508771929824561,
"grad_norm": 7.547133087976635,
"learning_rate": 4.9081770026187915e-06,
"loss": 0.2738,
"step": 50
},
{
"epoch": 0.42105263157894735,
"grad_norm": 6.164825995820736,
"learning_rate": 4.850663189692619e-06,
"loss": 0.2622,
"step": 60
},
{
"epoch": 0.49122807017543857,
"grad_norm": 10.82949040328208,
"learning_rate": 4.779749614980225e-06,
"loss": 0.2545,
"step": 70
},
{
"epoch": 0.5614035087719298,
"grad_norm": 9.291675578653022,
"learning_rate": 4.695840515470016e-06,
"loss": 0.2443,
"step": 80
},
{
"epoch": 0.631578947368421,
"grad_norm": 4.483428430129757,
"learning_rate": 4.5994142080684956e-06,
"loss": 0.24,
"step": 90
},
{
"epoch": 0.7017543859649122,
"grad_norm": 9.467430683733449,
"learning_rate": 4.491020362994168e-06,
"loss": 0.2357,
"step": 100
},
{
"epoch": 0.7719298245614035,
"grad_norm": 8.360804191198046,
"learning_rate": 4.3712768704277535e-06,
"loss": 0.2423,
"step": 110
},
{
"epoch": 0.8421052631578947,
"grad_norm": 9.376024777417225,
"learning_rate": 4.240866318280133e-06,
"loss": 0.2426,
"step": 120
},
{
"epoch": 0.9122807017543859,
"grad_norm": 42.513122163358034,
"learning_rate": 4.10053210115622e-06,
"loss": 0.2431,
"step": 130
},
{
"epoch": 0.9824561403508771,
"grad_norm": 10.60774073899308,
"learning_rate": 3.9510741826952835e-06,
"loss": 0.2296,
"step": 140
},
{
"epoch": 1.0491228070175438,
"grad_norm": 7.049299408091297,
"learning_rate": 3.793344535444142e-06,
"loss": 0.2265,
"step": 150
},
{
"epoch": 1.119298245614035,
"grad_norm": 66.59836296802126,
"learning_rate": 3.6282422842578846e-06,
"loss": 0.2229,
"step": 160
},
{
"epoch": 1.1894736842105262,
"grad_norm": 31.009452424712197,
"learning_rate": 3.4567085809127247e-06,
"loss": 0.2255,
"step": 170
},
{
"epoch": 1.2596491228070175,
"grad_norm": 4.707428577348247,
"learning_rate": 3.2797212391478727e-06,
"loss": 0.2208,
"step": 180
},
{
"epoch": 1.329824561403509,
"grad_norm": 6.260813622561182,
"learning_rate": 3.0982891607188948e-06,
"loss": 0.226,
"step": 190
},
{
"epoch": 1.4,
"grad_norm": 6.891400739921387,
"learning_rate": 2.9134465842364034e-06,
"loss": 0.2106,
"step": 200
},
{
"epoch": 1.4701754385964914,
"grad_norm": 6.707681637517704,
"learning_rate": 2.726247189574095e-06,
"loss": 0.2164,
"step": 210
},
{
"epoch": 1.5403508771929824,
"grad_norm": 14.86073483730446,
"learning_rate": 2.537758091453465e-06,
"loss": 0.2192,
"step": 220
},
{
"epoch": 1.6105263157894738,
"grad_norm": 4.385122732812432,
"learning_rate": 2.349053756444285e-06,
"loss": 0.2189,
"step": 230
},
{
"epoch": 1.6807017543859648,
"grad_norm": 7.004818522116804,
"learning_rate": 2.1612098780564715e-06,
"loss": 0.2126,
"step": 240
},
{
"epoch": 1.7508771929824563,
"grad_norm": 6.590975514106617,
"learning_rate": 1.9752972448378817e-06,
"loss": 0.2145,
"step": 250
},
{
"epoch": 1.8210526315789473,
"grad_norm": 9.753821755878821,
"learning_rate": 1.7923756364324494e-06,
"loss": 0.2159,
"step": 260
},
{
"epoch": 1.8912280701754387,
"grad_norm": 5.325787513700657,
"learning_rate": 1.613487782393661e-06,
"loss": 0.2162,
"step": 270
},
{
"epoch": 1.9614035087719297,
"grad_norm": 4.491557835089463,
"learning_rate": 1.4396534181906726e-06,
"loss": 0.2095,
"step": 280
},
{
"epoch": 2.0280701754385966,
"grad_norm": 12.559781170205573,
"learning_rate": 1.2718634722903073e-06,
"loss": 0.2099,
"step": 290
},
{
"epoch": 2.0982456140350876,
"grad_norm": 5.079848672597547,
"learning_rate": 1.1110744174509952e-06,
"loss": 0.209,
"step": 300
},
{
"epoch": 2.168421052631579,
"grad_norm": 10.17251965492991,
"learning_rate": 9.582028184286423e-07,
"loss": 0.2055,
"step": 310
},
{
"epoch": 2.23859649122807,
"grad_norm": 13.627772602845546,
"learning_rate": 8.141201071747784e-07,
"loss": 0.203,
"step": 320
},
{
"epoch": 2.3087719298245615,
"grad_norm": 8.355002030998532,
"learning_rate": 6.796476153105294e-07,
"loss": 0.2091,
"step": 330
},
{
"epoch": 2.3789473684210525,
"grad_norm": 4.530969715092393,
"learning_rate": 5.555518921934047e-07,
"loss": 0.2084,
"step": 340
},
{
"epoch": 2.449122807017544,
"grad_norm": 6.272704466018619,
"learning_rate": 4.4254033526585917e-07,
"loss": 0.2118,
"step": 350
},
{
"epoch": 2.519298245614035,
"grad_norm": 14.525483822981093,
"learning_rate": 3.412571575944679e-07,
"loss": 0.2087,
"step": 360
},
{
"epoch": 2.5894736842105264,
"grad_norm": 8.530705356489067,
"learning_rate": 2.522797155864354e-07,
"loss": 0.2053,
"step": 370
},
{
"epoch": 2.659649122807018,
"grad_norm": 21.754664451542073,
"learning_rate": 1.7611521781697644e-07,
"loss": 0.2015,
"step": 380
},
{
"epoch": 2.729824561403509,
"grad_norm": 5.016185711096282,
"learning_rate": 1.1319783372863601e-07,
"loss": 0.2029,
"step": 390
},
{
"epoch": 2.8,
"grad_norm": 5.315305503621668,
"learning_rate": 6.388621868416101e-08,
"loss": 0.2019,
"step": 400
},
{
"epoch": 2.8701754385964913,
"grad_norm": 8.076616074629916,
"learning_rate": 2.8461469481164682e-08,
"loss": 0.209,
"step": 410
},
{
"epoch": 2.9403508771929827,
"grad_norm": 8.636591588732433,
"learning_rate": 7.125521982997152e-09,
"loss": 0.2039,
"step": 420
},
{
"epoch": 3.007017543859649,
"grad_norm": 7.41019572219896,
"learning_rate": 0.0,
"loss": 0.1973,
"step": 430
},
{
"epoch": 3.07719298245614,
"grad_norm": 5.298408220149024,
"learning_rate": 1.7145346705573441e-06,
"loss": 0.2047,
"step": 440
},
{
"epoch": 3.1473684210526316,
"grad_norm": 7.552251123214438,
"learning_rate": 1.6077844460203207e-06,
"loss": 0.2043,
"step": 450
},
{
"epoch": 3.2175438596491226,
"grad_norm": 5.362701605328588,
"learning_rate": 1.502867501009409e-06,
"loss": 0.2069,
"step": 460
},
{
"epoch": 3.287719298245614,
"grad_norm": 4.441253980224051,
"learning_rate": 1.3999994135722822e-06,
"loss": 0.2041,
"step": 470
},
{
"epoch": 3.3578947368421055,
"grad_norm": 4.970304301865314,
"learning_rate": 1.2993915518673966e-06,
"loss": 0.2082,
"step": 480
},
{
"epoch": 3.4280701754385965,
"grad_norm": 23.210383061214984,
"learning_rate": 1.20125063985535e-06,
"loss": 0.214,
"step": 490
},
{
"epoch": 3.4982456140350875,
"grad_norm": 4.220133166172592,
"learning_rate": 1.105778332532927e-06,
"loss": 0.2005,
"step": 500
},
{
"epoch": 3.568421052631579,
"grad_norm": 4.116716856261486,
"learning_rate": 1.0131708015825668e-06,
"loss": 0.2105,
"step": 510
},
{
"epoch": 3.6385964912280704,
"grad_norm": 7.3207052924218665,
"learning_rate": 9.236183322886946e-07,
"loss": 0.2033,
"step": 520
},
{
"epoch": 3.7087719298245614,
"grad_norm": 3.852808758513771,
"learning_rate": 8.373049325491036e-07,
"loss": 0.1985,
"step": 530
},
{
"epoch": 3.7789473684210524,
"grad_norm": 15.250294356744208,
"learning_rate": 7.544079547848183e-07,
"loss": 0.1964,
"step": 540
},
{
"epoch": 3.849122807017544,
"grad_norm": 3.0509014746790166,
"learning_rate": 6.750977315252732e-07,
"loss": 0.2008,
"step": 550
},
{
"epoch": 3.9192982456140353,
"grad_norm": 4.687758452399206,
"learning_rate": 5.995372254176302e-07,
"loss": 0.2097,
"step": 560
},
{
"epoch": 3.9894736842105263,
"grad_norm": 9.721911452314314,
"learning_rate": 5.278816943793382e-07,
"loss": 0.201,
"step": 570
},
{
"epoch": 4.056140350877193,
"grad_norm": 2.403043490486729,
"learning_rate": 4.602783725820076e-07,
"loss": 0.1967,
"step": 580
},
{
"epoch": 4.126315789473685,
"grad_norm": 8.290723653754437,
"learning_rate": 3.9686616792204677e-07,
"loss": 0.1979,
"step": 590
},
{
"epoch": 4.196491228070175,
"grad_norm": 5.444718615266718,
"learning_rate": 3.3777537659973184e-07,
"loss": 0.2002,
"step": 600
},
{
"epoch": 4.266666666666667,
"grad_norm": 6.721894904138142,
"learning_rate": 2.831274153931357e-07,
"loss": 0.2005,
"step": 610
},
{
"epoch": 4.336842105263158,
"grad_norm": 15.697675859013298,
"learning_rate": 2.330345721770641e-07,
"loss": 0.1974,
"step": 620
},
{
"epoch": 4.4070175438596495,
"grad_norm": 10.41027198048078,
"learning_rate": 1.875997751995881e-07,
"loss": 0.1983,
"step": 630
},
{
"epoch": 4.47719298245614,
"grad_norm": 5.6755064919838345,
"learning_rate": 1.4691638159027105e-07,
"loss": 0.1941,
"step": 640
},
{
"epoch": 4.5473684210526315,
"grad_norm": 15.635280214115102,
"learning_rate": 1.1106798553464804e-07,
"loss": 0.199,
"step": 650
},
{
"epoch": 4.617543859649123,
"grad_norm": 16.997926750117426,
"learning_rate": 8.012824650910938e-08,
"loss": 0.2002,
"step": 660
},
{
"epoch": 4.687719298245614,
"grad_norm": 11.260397619043863,
"learning_rate": 5.416073792912091e-08,
"loss": 0.1999,
"step": 670
},
{
"epoch": 4.757894736842105,
"grad_norm": 4.712188848713119,
"learning_rate": 3.321881652177783e-08,
"loss": 0.198,
"step": 680
},
{
"epoch": 4.828070175438596,
"grad_norm": 6.993435000049924,
"learning_rate": 1.7345512691092083e-08,
"loss": 0.204,
"step": 690
},
{
"epoch": 4.898245614035088,
"grad_norm": 5.7468977622367055,
"learning_rate": 6.57344210128863e-09,
"loss": 0.2001,
"step": 700
},
{
"epoch": 4.968421052631579,
"grad_norm": 5.717757397470271,
"learning_rate": 9.247386597824315e-10,
"loss": 0.1992,
"step": 710
},
{
"epoch": 5.0,
"step": 715,
"total_flos": 2064156363063296.0,
"train_loss": 0.08062235821377148,
"train_runtime": 7241.919,
"train_samples_per_second": 6.295,
"train_steps_per_second": 0.099
}
],
"logging_steps": 10,
"max_steps": 715,
"num_input_tokens_seen": 0,
"num_train_epochs": 5,
"save_steps": 100,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": true
},
"attributes": {}
}
},
"total_flos": 2064156363063296.0,
"train_batch_size": 1,
"trial_name": null,
"trial_params": null
}