GIST-small-finefineweb / trainer_state.json
agentlans's picture
Upload 11 files
626c025 verified
Raw
History Blame Contribute Delete
17.5 kB
{
"best_global_step": 14238,
"best_metric": 1.4201050996780396,
"best_model_checkpoint": "./GIST-small-finefineweb/checkpoint-14238",
"epoch": 3.0,
"eval_steps": 500,
"global_step": 42714,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.0351172917544599,
"grad_norm": 4.260807991027832,
"learning_rate": 4.941588238048415e-05,
"loss": 3.80536328125,
"step": 500
},
{
"epoch": 0.0702345835089198,
"grad_norm": 5.151643753051758,
"learning_rate": 4.883059418457649e-05,
"loss": 3.020224609375,
"step": 1000
},
{
"epoch": 0.10535187526337969,
"grad_norm": 7.48809814453125,
"learning_rate": 4.824530598866882e-05,
"loss": 2.521716796875,
"step": 1500
},
{
"epoch": 0.1404691670178396,
"grad_norm": 8.032225608825684,
"learning_rate": 4.7660017792761155e-05,
"loss": 2.235208984375,
"step": 2000
},
{
"epoch": 0.17558645877229948,
"grad_norm": 9.012703895568848,
"learning_rate": 4.70747295968535e-05,
"loss": 2.0558740234375,
"step": 2500
},
{
"epoch": 0.21070375052675938,
"grad_norm": 5.909498691558838,
"learning_rate": 4.6489441400945825e-05,
"loss": 1.903140380859375,
"step": 3000
},
{
"epoch": 0.24582104228121926,
"grad_norm": 7.526004314422607,
"learning_rate": 4.590415320503817e-05,
"loss": 1.832560302734375,
"step": 3500
},
{
"epoch": 0.2809383340356792,
"grad_norm": 8.237626075744629,
"learning_rate": 4.5318865009130495e-05,
"loss": 1.748697998046875,
"step": 4000
},
{
"epoch": 0.31605562579013907,
"grad_norm": 11.181047439575195,
"learning_rate": 4.473357681322283e-05,
"loss": 1.688773681640625,
"step": 4500
},
{
"epoch": 0.35117291754459895,
"grad_norm": 5.37969970703125,
"learning_rate": 4.414828861731517e-05,
"loss": 1.678935546875,
"step": 5000
},
{
"epoch": 0.3862902092990589,
"grad_norm": 15.049540519714355,
"learning_rate": 4.35630004214075e-05,
"loss": 1.641348388671875,
"step": 5500
},
{
"epoch": 0.42140750105351876,
"grad_norm": 8.368888854980469,
"learning_rate": 4.297771222549984e-05,
"loss": 1.5826558837890625,
"step": 6000
},
{
"epoch": 0.45652479280797864,
"grad_norm": 12.3156156539917,
"learning_rate": 4.239242402959218e-05,
"loss": 1.581346435546875,
"step": 6500
},
{
"epoch": 0.4916420845624385,
"grad_norm": 7.462418079376221,
"learning_rate": 4.1807135833684505e-05,
"loss": 1.588016845703125,
"step": 7000
},
{
"epoch": 0.5267593763168984,
"grad_norm": 5.928471088409424,
"learning_rate": 4.122184763777685e-05,
"loss": 1.567573486328125,
"step": 7500
},
{
"epoch": 0.5618766680713584,
"grad_norm": 5.705861568450928,
"learning_rate": 4.0636559441869175e-05,
"loss": 1.53048828125,
"step": 8000
},
{
"epoch": 0.5969939598258183,
"grad_norm": 8.863656044006348,
"learning_rate": 4.0051271245961517e-05,
"loss": 1.5383482666015624,
"step": 8500
},
{
"epoch": 0.6321112515802781,
"grad_norm": 13.426504135131836,
"learning_rate": 3.946598305005385e-05,
"loss": 1.50315478515625,
"step": 9000
},
{
"epoch": 0.667228543334738,
"grad_norm": 7.727953910827637,
"learning_rate": 3.888069485414618e-05,
"loss": 1.4895361328125,
"step": 9500
},
{
"epoch": 0.7023458350891979,
"grad_norm": 10.484292030334473,
"learning_rate": 3.829540665823852e-05,
"loss": 1.503614013671875,
"step": 10000
},
{
"epoch": 0.7374631268436578,
"grad_norm": 8.725874900817871,
"learning_rate": 3.771011846233085e-05,
"loss": 1.476058837890625,
"step": 10500
},
{
"epoch": 0.7725804185981178,
"grad_norm": 5.166077613830566,
"learning_rate": 3.712483026642319e-05,
"loss": 1.4901533203125,
"step": 11000
},
{
"epoch": 0.8076977103525776,
"grad_norm": 10.984198570251465,
"learning_rate": 3.6539542070515526e-05,
"loss": 1.4634952392578124,
"step": 11500
},
{
"epoch": 0.8428150021070375,
"grad_norm": 15.131827354431152,
"learning_rate": 3.5954253874607855e-05,
"loss": 1.4686414794921876,
"step": 12000
},
{
"epoch": 0.8779322938614974,
"grad_norm": 11.210042953491211,
"learning_rate": 3.5368965678700196e-05,
"loss": 1.4881805419921874,
"step": 12500
},
{
"epoch": 0.9130495856159573,
"grad_norm": 7.214557647705078,
"learning_rate": 3.4783677482792524e-05,
"loss": 1.464077392578125,
"step": 13000
},
{
"epoch": 0.9481668773704172,
"grad_norm": 11.686339378356934,
"learning_rate": 3.4198389286884866e-05,
"loss": 1.444265869140625,
"step": 13500
},
{
"epoch": 0.983284169124877,
"grad_norm": 19.299360275268555,
"learning_rate": 3.36131010909772e-05,
"loss": 1.4215205078125,
"step": 14000
},
{
"epoch": 1.0,
"eval_accuracy": 0.5597014925373134,
"eval_loss": 1.4201050996780396,
"eval_runtime": 10.7818,
"eval_samples_per_second": 1864.261,
"eval_steps_per_second": 233.079,
"step": 14238
},
{
"epoch": 1.018401460879337,
"grad_norm": 8.159019470214844,
"learning_rate": 3.302781289506953e-05,
"loss": 1.3587421875,
"step": 14500
},
{
"epoch": 1.0535187526337968,
"grad_norm": 5.230182647705078,
"learning_rate": 3.244252469916187e-05,
"loss": 1.23601025390625,
"step": 15000
},
{
"epoch": 1.0886360443882568,
"grad_norm": 9.535394668579102,
"learning_rate": 3.1857236503254206e-05,
"loss": 1.2193956298828126,
"step": 15500
},
{
"epoch": 1.1237533361427168,
"grad_norm": 12.504450798034668,
"learning_rate": 3.127194830734654e-05,
"loss": 1.257890625,
"step": 16000
},
{
"epoch": 1.1588706278971765,
"grad_norm": 9.120118141174316,
"learning_rate": 3.0686660111438876e-05,
"loss": 1.2693642578125,
"step": 16500
},
{
"epoch": 1.1939879196516365,
"grad_norm": 10.734423637390137,
"learning_rate": 3.0101371915531208e-05,
"loss": 1.197530029296875,
"step": 17000
},
{
"epoch": 1.2291052114060963,
"grad_norm": 14.132915496826172,
"learning_rate": 2.9516083719623543e-05,
"loss": 1.21922607421875,
"step": 17500
},
{
"epoch": 1.2642225031605563,
"grad_norm": 6.775696754455566,
"learning_rate": 2.893079552371588e-05,
"loss": 1.227854736328125,
"step": 18000
},
{
"epoch": 1.2993397949150163,
"grad_norm": 19.711624145507812,
"learning_rate": 2.8345507327808212e-05,
"loss": 1.2406669921875,
"step": 18500
},
{
"epoch": 1.334457086669476,
"grad_norm": 13.559345245361328,
"learning_rate": 2.776021913190055e-05,
"loss": 1.216806396484375,
"step": 19000
},
{
"epoch": 1.3695743784239358,
"grad_norm": 9.309524536132812,
"learning_rate": 2.7174930935992882e-05,
"loss": 1.24202587890625,
"step": 19500
},
{
"epoch": 1.4046916701783958,
"grad_norm": 10.314745903015137,
"learning_rate": 2.6589642740085217e-05,
"loss": 1.2581201171875,
"step": 20000
},
{
"epoch": 1.4398089619328558,
"grad_norm": 5.401873588562012,
"learning_rate": 2.6004354544177556e-05,
"loss": 1.2209202880859376,
"step": 20500
},
{
"epoch": 1.4749262536873156,
"grad_norm": 15.076764106750488,
"learning_rate": 2.5419066348269887e-05,
"loss": 1.2383526611328124,
"step": 21000
},
{
"epoch": 1.5100435454417755,
"grad_norm": 22.0113468170166,
"learning_rate": 2.4833778152362226e-05,
"loss": 1.22856103515625,
"step": 21500
},
{
"epoch": 1.5451608371962355,
"grad_norm": 17.75559425354004,
"learning_rate": 2.424848995645456e-05,
"loss": 1.20788134765625,
"step": 22000
},
{
"epoch": 1.5802781289506953,
"grad_norm": 10.342529296875,
"learning_rate": 2.3663201760546892e-05,
"loss": 1.256087158203125,
"step": 22500
},
{
"epoch": 1.615395420705155,
"grad_norm": 9.013571739196777,
"learning_rate": 2.307791356463923e-05,
"loss": 1.205993408203125,
"step": 23000
},
{
"epoch": 1.650512712459615,
"grad_norm": 14.434803009033203,
"learning_rate": 2.2492625368731566e-05,
"loss": 1.233262939453125,
"step": 23500
},
{
"epoch": 1.685630004214075,
"grad_norm": 9.884788513183594,
"learning_rate": 2.19073371728239e-05,
"loss": 1.23419775390625,
"step": 24000
},
{
"epoch": 1.7207472959685348,
"grad_norm": 5.8740315437316895,
"learning_rate": 2.1322048976916235e-05,
"loss": 1.183447265625,
"step": 24500
},
{
"epoch": 1.7558645877229948,
"grad_norm": 10.489058494567871,
"learning_rate": 2.0736760781008567e-05,
"loss": 1.21093408203125,
"step": 25000
},
{
"epoch": 1.7909818794774548,
"grad_norm": 9.570001602172852,
"learning_rate": 2.0151472585100905e-05,
"loss": 1.22470751953125,
"step": 25500
},
{
"epoch": 1.8260991712319146,
"grad_norm": 8.933923721313477,
"learning_rate": 1.956618438919324e-05,
"loss": 1.20744775390625,
"step": 26000
},
{
"epoch": 1.8612164629863743,
"grad_norm": 10.908781051635742,
"learning_rate": 1.8980896193285575e-05,
"loss": 1.2203123779296876,
"step": 26500
},
{
"epoch": 1.8963337547408345,
"grad_norm": 15.087785720825195,
"learning_rate": 1.839560799737791e-05,
"loss": 1.17535888671875,
"step": 27000
},
{
"epoch": 1.9314510464952943,
"grad_norm": 12.269214630126953,
"learning_rate": 1.7810319801470245e-05,
"loss": 1.21442138671875,
"step": 27500
},
{
"epoch": 1.966568338249754,
"grad_norm": 13.241905212402344,
"learning_rate": 1.722503160556258e-05,
"loss": 1.188049072265625,
"step": 28000
},
{
"epoch": 2.0,
"eval_accuracy": 0.575820895522388,
"eval_loss": 1.3501036167144775,
"eval_runtime": 10.5973,
"eval_samples_per_second": 1896.712,
"eval_steps_per_second": 237.136,
"step": 28476
},
{
"epoch": 2.0016856300042143,
"grad_norm": 8.780560493469238,
"learning_rate": 1.6639743409654915e-05,
"loss": 1.2041591796875,
"step": 28500
},
{
"epoch": 2.036802921758674,
"grad_norm": 11.652058601379395,
"learning_rate": 1.605445521374725e-05,
"loss": 0.984854736328125,
"step": 29000
},
{
"epoch": 2.071920213513134,
"grad_norm": 7.791229724884033,
"learning_rate": 1.5469167017839585e-05,
"loss": 1.007615966796875,
"step": 29500
},
{
"epoch": 2.1070375052675936,
"grad_norm": 12.308660507202148,
"learning_rate": 1.488387882193192e-05,
"loss": 1.0033169555664063,
"step": 30000
},
{
"epoch": 2.142154797022054,
"grad_norm": 13.58169174194336,
"learning_rate": 1.4298590626024255e-05,
"loss": 0.974229736328125,
"step": 30500
},
{
"epoch": 2.1772720887765136,
"grad_norm": 15.975540161132812,
"learning_rate": 1.371330243011659e-05,
"loss": 0.9855778198242188,
"step": 31000
},
{
"epoch": 2.2123893805309733,
"grad_norm": 14.320321083068848,
"learning_rate": 1.3128014234208923e-05,
"loss": 1.004745849609375,
"step": 31500
},
{
"epoch": 2.2475066722854335,
"grad_norm": 11.359272956848145,
"learning_rate": 1.2542726038301262e-05,
"loss": 1.0171809692382812,
"step": 32000
},
{
"epoch": 2.2826239640398933,
"grad_norm": 13.039071083068848,
"learning_rate": 1.1957437842393595e-05,
"loss": 0.9913959350585938,
"step": 32500
},
{
"epoch": 2.317741255794353,
"grad_norm": 13.048351287841797,
"learning_rate": 1.137214964648593e-05,
"loss": 0.9649514770507812,
"step": 33000
},
{
"epoch": 2.352858547548813,
"grad_norm": 10.371077537536621,
"learning_rate": 1.0786861450578267e-05,
"loss": 0.9909617919921875,
"step": 33500
},
{
"epoch": 2.387975839303273,
"grad_norm": 11.289835929870605,
"learning_rate": 1.02015732546706e-05,
"loss": 0.9919574584960937,
"step": 34000
},
{
"epoch": 2.423093131057733,
"grad_norm": 27.44933319091797,
"learning_rate": 9.616285058762935e-06,
"loss": 1.0055829467773438,
"step": 34500
},
{
"epoch": 2.4582104228121926,
"grad_norm": 11.161052703857422,
"learning_rate": 9.03099686285527e-06,
"loss": 0.9602240600585937,
"step": 35000
},
{
"epoch": 2.493327714566653,
"grad_norm": 17.08051109313965,
"learning_rate": 8.445708666947605e-06,
"loss": 0.9863092041015625,
"step": 35500
},
{
"epoch": 2.5284450063211126,
"grad_norm": 17.54767608642578,
"learning_rate": 7.860420471039941e-06,
"loss": 0.9886974487304687,
"step": 36000
},
{
"epoch": 2.5635622980755723,
"grad_norm": 11.948639869689941,
"learning_rate": 7.275132275132275e-06,
"loss": 0.9745349731445313,
"step": 36500
},
{
"epoch": 2.5986795898300326,
"grad_norm": 10.49316692352295,
"learning_rate": 6.6898440792246105e-06,
"loss": 0.9702930908203125,
"step": 37000
},
{
"epoch": 2.6337968815844923,
"grad_norm": 8.751533508300781,
"learning_rate": 6.1045558833169455e-06,
"loss": 0.9776581420898437,
"step": 37500
},
{
"epoch": 2.668914173338952,
"grad_norm": 12.580408096313477,
"learning_rate": 5.51926768740928e-06,
"loss": 0.9431263427734375,
"step": 38000
},
{
"epoch": 2.704031465093412,
"grad_norm": 8.419705390930176,
"learning_rate": 4.933979491501615e-06,
"loss": 0.9579478149414062,
"step": 38500
},
{
"epoch": 2.7391487568478716,
"grad_norm": 9.203957557678223,
"learning_rate": 4.34869129559395e-06,
"loss": 0.9422415771484375,
"step": 39000
},
{
"epoch": 2.774266048602332,
"grad_norm": 9.370144844055176,
"learning_rate": 3.7634030996862857e-06,
"loss": 0.9548507080078125,
"step": 39500
},
{
"epoch": 2.8093833403567916,
"grad_norm": 12.517521858215332,
"learning_rate": 3.1781149037786207e-06,
"loss": 0.9578753051757812,
"step": 40000
},
{
"epoch": 2.8445006321112514,
"grad_norm": 6.460758209228516,
"learning_rate": 2.5928267078709557e-06,
"loss": 0.9494760131835938,
"step": 40500
},
{
"epoch": 2.8796179238657116,
"grad_norm": 13.693047523498535,
"learning_rate": 2.007538511963291e-06,
"loss": 0.9522800903320312,
"step": 41000
},
{
"epoch": 2.9147352156201713,
"grad_norm": 16.411876678466797,
"learning_rate": 1.4222503160556258e-06,
"loss": 0.9692906494140625,
"step": 41500
},
{
"epoch": 2.949852507374631,
"grad_norm": 10.933576583862305,
"learning_rate": 8.369621201479609e-07,
"loss": 0.9742265625,
"step": 42000
},
{
"epoch": 2.9849697991290913,
"grad_norm": 9.118729591369629,
"learning_rate": 2.5167392424029596e-07,
"loss": 0.9880457763671875,
"step": 42500
},
{
"epoch": 3.0,
"eval_accuracy": 0.577363184079602,
"eval_loss": 1.3794599771499634,
"eval_runtime": 10.5799,
"eval_samples_per_second": 1899.835,
"eval_steps_per_second": 237.527,
"step": 42714
},
{
"epoch": 3.0,
"step": 42714,
"total_flos": 5633745170457600.0,
"train_loss": 1.3238096198333684,
"train_runtime": 720.633,
"train_samples_per_second": 474.166,
"train_steps_per_second": 59.273
}
],
"logging_steps": 500,
"max_steps": 42714,
"num_input_tokens_seen": 0,
"num_train_epochs": 3,
"save_steps": 500,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": true
},
"attributes": {}
}
},
"total_flos": 5633745170457600.0,
"train_batch_size": 8,
"trial_name": null,
"trial_params": null
}