VineBot-checkpoint-2530 / trainer_state.json
exzort's picture
Upload folder using huggingface_hub
2e06ff4 verified
Raw
History Blame Contribute Delete
12.4 kB
{
"best_global_step": 2530,
"best_metric": 1.2116608619689941,
"best_model_checkpoint": "/content/drive/MyDrive/tinyllama-qna-vinebot-41/checkpoint-2530",
"epoch": 11.0,
"eval_steps": 500,
"global_step": 2530,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.2178649237472767,
"grad_norm": 1.0952818393707275,
"learning_rate": 9.99742437568085e-05,
"loss": 2.0272,
"step": 50
},
{
"epoch": 0.4357298474945534,
"grad_norm": 1.8644359111785889,
"learning_rate": 9.989032472699667e-05,
"loss": 1.6038,
"step": 100
},
{
"epoch": 0.6535947712418301,
"grad_norm": 1.3627630472183228,
"learning_rate": 9.974823581026451e-05,
"loss": 1.5493,
"step": 150
},
{
"epoch": 0.8714596949891068,
"grad_norm": 1.9645041227340698,
"learning_rate": 9.954814267593302e-05,
"loss": 1.501,
"step": 200
},
{
"epoch": 1.0,
"eval_loss": 1.4637842178344727,
"eval_runtime": 16.0672,
"eval_samples_per_second": 14.253,
"eval_steps_per_second": 1.805,
"eval_token_accuracy": 0.0004675628151744604,
"step": 230
},
{
"epoch": 1.0871459694989107,
"grad_norm": 1.8468650579452515,
"learning_rate": 9.929027862364612e-05,
"loss": 1.4942,
"step": 250
},
{
"epoch": 1.3050108932461875,
"grad_norm": 1.7907674312591553,
"learning_rate": 9.897494431135397e-05,
"loss": 1.4429,
"step": 300
},
{
"epoch": 1.522875816993464,
"grad_norm": 2.254640817642212,
"learning_rate": 9.860250740475903e-05,
"loss": 1.3989,
"step": 350
},
{
"epoch": 1.7407407407407407,
"grad_norm": 2.1234710216522217,
"learning_rate": 9.817340214863442e-05,
"loss": 1.4048,
"step": 400
},
{
"epoch": 1.9586056644880174,
"grad_norm": 2.362985372543335,
"learning_rate": 9.768812886051388e-05,
"loss": 1.3909,
"step": 450
},
{
"epoch": 2.0,
"eval_loss": 1.3868604898452759,
"eval_runtime": 11.2019,
"eval_samples_per_second": 20.443,
"eval_steps_per_second": 2.589,
"eval_token_accuracy": 0.0007013442227616906,
"step": 460
},
{
"epoch": 2.1742919389978215,
"grad_norm": 2.196892499923706,
"learning_rate": 9.714725334734398e-05,
"loss": 1.3513,
"step": 500
},
{
"epoch": 2.392156862745098,
"grad_norm": 1.9330474138259888,
"learning_rate": 9.655140624577842e-05,
"loss": 1.3596,
"step": 550
},
{
"epoch": 2.610021786492375,
"grad_norm": 2.6164073944091797,
"learning_rate": 9.590128228688399e-05,
"loss": 1.3227,
"step": 600
},
{
"epoch": 2.8278867102396514,
"grad_norm": 2.614471673965454,
"learning_rate": 9.519763948611517e-05,
"loss": 1.3292,
"step": 650
},
{
"epoch": 3.0,
"eval_loss": 1.3313415050506592,
"eval_runtime": 11.5266,
"eval_samples_per_second": 19.867,
"eval_steps_per_second": 2.516,
"eval_token_accuracy": 0.0006428988999687135,
"step": 690
},
{
"epoch": 3.0435729847494555,
"grad_norm": 2.6838598251342773,
"learning_rate": 9.44412982595021e-05,
"loss": 1.2884,
"step": 700
},
{
"epoch": 3.261437908496732,
"grad_norm": 2.4964945316314697,
"learning_rate": 9.363314046708207e-05,
"loss": 1.2845,
"step": 750
},
{
"epoch": 3.4793028322440085,
"grad_norm": 2.8117692470550537,
"learning_rate": 9.277410838469025e-05,
"loss": 1.2864,
"step": 800
},
{
"epoch": 3.6971677559912854,
"grad_norm": 2.6701340675354004,
"learning_rate": 9.186520360530817e-05,
"loss": 1.2421,
"step": 850
},
{
"epoch": 3.915032679738562,
"grad_norm": 2.503159523010254,
"learning_rate": 9.090748587125118e-05,
"loss": 1.2604,
"step": 900
},
{
"epoch": 4.0,
"eval_loss": 1.2954490184783936,
"eval_runtime": 11.1793,
"eval_samples_per_second": 20.484,
"eval_steps_per_second": 2.594,
"eval_token_accuracy": 0.0005260081961750984,
"step": 920
},
{
"epoch": 4.130718954248366,
"grad_norm": 3.0685791969299316,
"learning_rate": 8.990207183855619e-05,
"loss": 1.254,
"step": 950
},
{
"epoch": 4.348583877995643,
"grad_norm": 2.6776204109191895,
"learning_rate": 8.885013377501082e-05,
"loss": 1.2521,
"step": 1000
},
{
"epoch": 4.5664488017429194,
"grad_norm": 2.358538866043091,
"learning_rate": 8.775289819334149e-05,
"loss": 1.2206,
"step": 1050
},
{
"epoch": 4.784313725490196,
"grad_norm": 2.6545300483703613,
"learning_rate": 8.66116444211545e-05,
"loss": 1.2133,
"step": 1100
},
{
"epoch": 5.0,
"grad_norm": 3.259941339492798,
"learning_rate": 8.542770310929729e-05,
"loss": 1.1917,
"step": 1150
},
{
"epoch": 5.0,
"eval_loss": 1.2690343856811523,
"eval_runtime": 11.6359,
"eval_samples_per_second": 19.68,
"eval_steps_per_second": 2.492,
"eval_token_accuracy": 0.0006428988999687135,
"step": 1150
},
{
"epoch": 5.2178649237472765,
"grad_norm": 2.7574832439422607,
"learning_rate": 8.420245468037895e-05,
"loss": 1.1934,
"step": 1200
},
{
"epoch": 5.435729847494553,
"grad_norm": 2.779545783996582,
"learning_rate": 8.293732771925941e-05,
"loss": 1.1575,
"step": 1250
},
{
"epoch": 5.65359477124183,
"grad_norm": 2.864579677581787,
"learning_rate": 8.163379730738322e-05,
"loss": 1.1917,
"step": 1300
},
{
"epoch": 5.871459694989107,
"grad_norm": 3.3692564964294434,
"learning_rate": 8.029338330290068e-05,
"loss": 1.1852,
"step": 1350
},
{
"epoch": 6.0,
"eval_loss": 1.2505407333374023,
"eval_runtime": 11.1009,
"eval_samples_per_second": 20.629,
"eval_steps_per_second": 2.612,
"eval_token_accuracy": 0.0005260081961750984,
"step": 1380
},
{
"epoch": 6.087145969498911,
"grad_norm": 2.826042890548706,
"learning_rate": 7.891764856858109e-05,
"loss": 1.1599,
"step": 1400
},
{
"epoch": 6.3050108932461875,
"grad_norm": 2.9128215312957764,
"learning_rate": 7.750819714958487e-05,
"loss": 1.111,
"step": 1450
},
{
"epoch": 6.522875816993464,
"grad_norm": 2.81060528755188,
"learning_rate": 7.606667240321847e-05,
"loss": 1.1499,
"step": 1500
},
{
"epoch": 6.7407407407407405,
"grad_norm": 2.8380608558654785,
"learning_rate": 7.459475508285339e-05,
"loss": 1.1569,
"step": 1550
},
{
"epoch": 6.958605664488017,
"grad_norm": 3.2343266010284424,
"learning_rate": 7.309416137824286e-05,
"loss": 1.1534,
"step": 1600
},
{
"epoch": 7.0,
"eval_loss": 1.2362457513809204,
"eval_runtime": 11.2969,
"eval_samples_per_second": 20.271,
"eval_steps_per_second": 2.567,
"eval_token_accuracy": 0.0004675628151744604,
"step": 1610
},
{
"epoch": 7.174291938997821,
"grad_norm": 3.2908899784088135,
"learning_rate": 7.156664091452134e-05,
"loss": 1.1062,
"step": 1650
},
{
"epoch": 7.392156862745098,
"grad_norm": 2.7138006687164307,
"learning_rate": 7.001397471221999e-05,
"loss": 1.0859,
"step": 1700
},
{
"epoch": 7.610021786492375,
"grad_norm": 2.898587942123413,
"learning_rate": 6.843797311067626e-05,
"loss": 1.1103,
"step": 1750
},
{
"epoch": 7.827886710239651,
"grad_norm": 3.0582330226898193,
"learning_rate": 6.684047365725933e-05,
"loss": 1.156,
"step": 1800
},
{
"epoch": 8.0,
"eval_loss": 1.223596215248108,
"eval_runtime": 11.3821,
"eval_samples_per_second": 20.119,
"eval_steps_per_second": 2.548,
"eval_token_accuracy": 0.0005260081961750984,
"step": 1840
},
{
"epoch": 8.043572984749455,
"grad_norm": 3.3806657791137695,
"learning_rate": 6.522333896487195e-05,
"loss": 1.0814,
"step": 1850
},
{
"epoch": 8.261437908496733,
"grad_norm": 2.9672374725341797,
"learning_rate": 6.358845454022724e-05,
"loss": 1.0857,
"step": 1900
},
{
"epoch": 8.47930283224401,
"grad_norm": 3.0525612831115723,
"learning_rate": 6.193772658543209e-05,
"loss": 1.08,
"step": 1950
},
{
"epoch": 8.697167755991286,
"grad_norm": 3.032627582550049,
"learning_rate": 6.0273079775440875e-05,
"loss": 1.076,
"step": 2000
},
{
"epoch": 8.915032679738562,
"grad_norm": 2.920048475265503,
"learning_rate": 5.859645501397048e-05,
"loss": 1.1022,
"step": 2050
},
{
"epoch": 9.0,
"eval_loss": 1.2166547775268555,
"eval_runtime": 11.1008,
"eval_samples_per_second": 20.629,
"eval_steps_per_second": 2.612,
"eval_token_accuracy": 0.0005260081961750984,
"step": 2070
},
{
"epoch": 9.130718954248366,
"grad_norm": 2.8219351768493652,
"learning_rate": 5.6909807170493415e-05,
"loss": 1.0579,
"step": 2100
},
{
"epoch": 9.348583877995642,
"grad_norm": 2.89310359954834,
"learning_rate": 5.521510280094744e-05,
"loss": 1.0563,
"step": 2150
},
{
"epoch": 9.566448801742919,
"grad_norm": 3.3332712650299072,
"learning_rate": 5.3514317854819365e-05,
"loss": 1.0717,
"step": 2200
},
{
"epoch": 9.784313725490197,
"grad_norm": 3.26670241355896,
"learning_rate": 5.1809435371276247e-05,
"loss": 1.039,
"step": 2250
},
{
"epoch": 10.0,
"grad_norm": 5.068799018859863,
"learning_rate": 5.010244316703052e-05,
"loss": 1.0618,
"step": 2300
},
{
"epoch": 10.0,
"eval_loss": 1.2120957374572754,
"eval_runtime": 11.5797,
"eval_samples_per_second": 19.776,
"eval_steps_per_second": 2.504,
"eval_token_accuracy": 0.0005260081961750984,
"step": 2300
},
{
"epoch": 10.217864923747277,
"grad_norm": 3.5102055072784424,
"learning_rate": 4.839533151863457e-05,
"loss": 1.0155,
"step": 2350
},
{
"epoch": 10.435729847494553,
"grad_norm": 2.582735538482666,
"learning_rate": 4.66900908419073e-05,
"loss": 1.0536,
"step": 2400
},
{
"epoch": 10.65359477124183,
"grad_norm": 3.611645460128784,
"learning_rate": 4.498870937119835e-05,
"loss": 1.033,
"step": 2450
},
{
"epoch": 10.871459694989106,
"grad_norm": 3.5989201068878174,
"learning_rate": 4.3293170841195784e-05,
"loss": 1.0315,
"step": 2500
},
{
"epoch": 11.0,
"eval_loss": 1.2116608619689941,
"eval_runtime": 11.1368,
"eval_samples_per_second": 20.562,
"eval_steps_per_second": 2.604,
"eval_token_accuracy": 0.0005260081961750984,
"step": 2530
}
],
"logging_steps": 50,
"max_steps": 4600,
"num_input_tokens_seen": 0,
"num_train_epochs": 20,
"save_steps": 500,
"stateful_callbacks": {
"EarlyStoppingCallback": {
"args": {
"early_stopping_patience": 2,
"early_stopping_threshold": 0.0
},
"attributes": {
"early_stopping_patience_counter": 0
}
},
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": false
},
"attributes": {}
}
},
"total_flos": 1.2450731154997248e+16,
"train_batch_size": 4,
"trial_name": null,
"trial_params": null
}