adaption_personal_finance_advice / trainer_state.json
prathmeshadsod's picture
Add 11 files
6574748 verified
Raw
History Blame Contribute Delete
13.5 kB
{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 3.0,
"eval_steps": 13,
"global_step": 66,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.045454545454545456,
"grad_norm": 0.6484919786453247,
"learning_rate": 0.0,
"loss": 1.5302734375,
"step": 1
},
{
"epoch": 0.09090909090909091,
"grad_norm": 0.6537308692932129,
"learning_rate": 2.5e-05,
"loss": 1.50732421875,
"step": 2
},
{
"epoch": 0.13636363636363635,
"grad_norm": 0.673050582408905,
"learning_rate": 5e-05,
"loss": 1.5185546875,
"step": 3
},
{
"epoch": 0.18181818181818182,
"grad_norm": 0.5060420036315918,
"learning_rate": 7.500000000000001e-05,
"loss": 1.511138916015625,
"step": 4
},
{
"epoch": 0.22727272727272727,
"grad_norm": 0.30887529253959656,
"learning_rate": 0.0001,
"loss": 1.40087890625,
"step": 5
},
{
"epoch": 0.2727272727272727,
"grad_norm": 0.20122277736663818,
"learning_rate": 9.994224282269737e-05,
"loss": 1.3603515625,
"step": 6
},
{
"epoch": 0.3181818181818182,
"grad_norm": 0.24981580674648285,
"learning_rate": 9.976911955263529e-05,
"loss": 1.353271484375,
"step": 7
},
{
"epoch": 0.36363636363636365,
"grad_norm": 0.27218642830848694,
"learning_rate": 9.948107459476501e-05,
"loss": 1.30078125,
"step": 8
},
{
"epoch": 0.4090909090909091,
"grad_norm": 0.23594558238983154,
"learning_rate": 9.907884735636226e-05,
"loss": 1.2880859375,
"step": 9
},
{
"epoch": 0.45454545454545453,
"grad_norm": 0.22113916277885437,
"learning_rate": 9.856347034897919e-05,
"loss": 1.26611328125,
"step": 10
},
{
"epoch": 0.5,
"grad_norm": 0.207451730966568,
"learning_rate": 9.793626653800219e-05,
"loss": 1.226318359375,
"step": 11
},
{
"epoch": 0.5454545454545454,
"grad_norm": 0.20755015313625336,
"learning_rate": 9.719884594661864e-05,
"loss": 1.2568359375,
"step": 12
},
{
"epoch": 0.5909090909090909,
"grad_norm": 0.17007851600646973,
"learning_rate": 9.635310152291039e-05,
"loss": 1.239501953125,
"step": 13
},
{
"epoch": 0.6363636363636364,
"grad_norm": 0.1428622305393219,
"learning_rate": 9.540120428068338e-05,
"loss": 1.202880859375,
"step": 14
},
{
"epoch": 0.6363636363636364,
"eval_loss": 1.1806640625,
"eval_runtime": 5.1037,
"eval_samples_per_second": 0.784,
"eval_steps_per_second": 0.196,
"step": 14
},
{
"epoch": 0.6818181818181818,
"grad_norm": 0.13083815574645996,
"learning_rate": 9.43455977265062e-05,
"loss": 1.197509765625,
"step": 15
},
{
"epoch": 0.7272727272727273,
"grad_norm": 0.13909989595413208,
"learning_rate": 9.31889915872638e-05,
"loss": 1.187744140625,
"step": 16
},
{
"epoch": 0.7727272727272727,
"grad_norm": 0.14068648219108582,
"learning_rate": 9.193435485432745e-05,
"loss": 1.18115234375,
"step": 17
},
{
"epoch": 0.8181818181818182,
"grad_norm": 0.14103928208351135,
"learning_rate": 9.058490816219643e-05,
"loss": 1.152587890625,
"step": 18
},
{
"epoch": 0.8636363636363636,
"grad_norm": 0.1104067787528038,
"learning_rate": 8.914411552117559e-05,
"loss": 1.05517578125,
"step": 19
},
{
"epoch": 0.9090909090909091,
"grad_norm": 0.11927060782909393,
"learning_rate": 8.76156754253104e-05,
"loss": 1.193359375,
"step": 20
},
{
"epoch": 0.9545454545454546,
"grad_norm": 0.11170849949121475,
"learning_rate": 8.600351135840589e-05,
"loss": 1.12890625,
"step": 21
},
{
"epoch": 1.0,
"grad_norm": 0.1104699969291687,
"learning_rate": 8.431176172250002e-05,
"loss": 1.13330078125,
"step": 22
},
{
"epoch": 1.0454545454545454,
"grad_norm": 0.09613741189241409,
"learning_rate": 8.254476921464484e-05,
"loss": 1.119140625,
"step": 23
},
{
"epoch": 1.0909090909090908,
"grad_norm": 0.09008456021547318,
"learning_rate": 8.070706967926565e-05,
"loss": 1.09521484375,
"step": 24
},
{
"epoch": 1.1363636363636362,
"grad_norm": 0.09935105592012405,
"learning_rate": 7.880338046471331e-05,
"loss": 1.09326171875,
"step": 25
},
{
"epoch": 1.1818181818181819,
"grad_norm": 0.09212969243526459,
"learning_rate": 7.683858831389867e-05,
"loss": 1.159027099609375,
"step": 26
},
{
"epoch": 1.2272727272727273,
"grad_norm": 0.08778497576713562,
"learning_rate": 7.481773682009356e-05,
"loss": 1.083740234375,
"step": 27
},
{
"epoch": 1.2272727272727273,
"eval_loss": 1.0927734375,
"eval_runtime": 5.117,
"eval_samples_per_second": 0.782,
"eval_steps_per_second": 0.195,
"step": 27
},
{
"epoch": 1.2727272727272727,
"grad_norm": 0.08414468914270401,
"learning_rate": 7.274601348009935e-05,
"loss": 1.099609375,
"step": 28
},
{
"epoch": 1.3181818181818181,
"grad_norm": 0.08235311508178711,
"learning_rate": 7.062873637801692e-05,
"loss": 1.10400390625,
"step": 29
},
{
"epoch": 1.3636363636363638,
"grad_norm": 0.0841815173625946,
"learning_rate": 6.847134053380112e-05,
"loss": 1.07568359375,
"step": 30
},
{
"epoch": 1.4090909090909092,
"grad_norm": 0.07870905101299286,
"learning_rate": 6.627936395164243e-05,
"loss": 1.087158203125,
"step": 31
},
{
"epoch": 1.4545454545454546,
"grad_norm": 0.09404882043600082,
"learning_rate": 6.40584334039897e-05,
"loss": 1.08837890625,
"step": 32
},
{
"epoch": 1.5,
"grad_norm": 0.07923950999975204,
"learning_rate": 6.181424998770595e-05,
"loss": 1.05810546875,
"step": 33
},
{
"epoch": 1.5454545454545454,
"grad_norm": 0.08308933675289154,
"learning_rate": 5.955257448943445e-05,
"loss": 1.1044921875,
"step": 34
},
{
"epoch": 1.5909090909090908,
"grad_norm": 0.07987320423126221,
"learning_rate": 5.727921259774208e-05,
"loss": 1.099365234375,
"step": 35
},
{
"epoch": 1.6363636363636362,
"grad_norm": 0.07347641885280609,
"learning_rate": 5.500000000000001e-05,
"loss": 1.08056640625,
"step": 36
},
{
"epoch": 1.6818181818181817,
"grad_norm": 0.08490364253520966,
"learning_rate": 5.2720787402257935e-05,
"loss": 1.07666015625,
"step": 37
},
{
"epoch": 1.7272727272727273,
"grad_norm": 0.07508078962564468,
"learning_rate": 5.044742551056556e-05,
"loss": 1.074951171875,
"step": 38
},
{
"epoch": 1.7727272727272727,
"grad_norm": 0.07631556689739227,
"learning_rate": 4.8185750012294065e-05,
"loss": 1.07568359375,
"step": 39
},
{
"epoch": 1.8181818181818183,
"grad_norm": 0.08071254193782806,
"learning_rate": 4.594156659601029e-05,
"loss": 1.05029296875,
"step": 40
},
{
"epoch": 1.8181818181818183,
"eval_loss": 1.055419921875,
"eval_runtime": 5.1075,
"eval_samples_per_second": 0.783,
"eval_steps_per_second": 0.196,
"step": 40
},
{
"epoch": 1.8636363636363638,
"grad_norm": 0.0675211250782013,
"learning_rate": 4.372063604835758e-05,
"loss": 0.97119140625,
"step": 41
},
{
"epoch": 1.9090909090909092,
"grad_norm": 0.08918321132659912,
"learning_rate": 4.152865946619889e-05,
"loss": 1.106689453125,
"step": 42
},
{
"epoch": 1.9545454545454546,
"grad_norm": 0.06920626759529114,
"learning_rate": 3.93712636219831e-05,
"loss": 1.04638671875,
"step": 43
},
{
"epoch": 2.0,
"grad_norm": 0.09061622619628906,
"learning_rate": 3.725398651990067e-05,
"loss": 1.0537109375,
"step": 44
},
{
"epoch": 2.0454545454545454,
"grad_norm": 0.07046699523925781,
"learning_rate": 3.518226317990646e-05,
"loss": 1.046142578125,
"step": 45
},
{
"epoch": 2.090909090909091,
"grad_norm": 0.06979958713054657,
"learning_rate": 3.3161411686101364e-05,
"loss": 1.0283203125,
"step": 46
},
{
"epoch": 2.1363636363636362,
"grad_norm": 0.07331069558858871,
"learning_rate": 3.119661953528671e-05,
"loss": 1.03173828125,
"step": 47
},
{
"epoch": 2.1818181818181817,
"grad_norm": 0.07536927610635757,
"learning_rate": 2.9292930320734335e-05,
"loss": 1.0992240905761719,
"step": 48
},
{
"epoch": 2.227272727272727,
"grad_norm": 0.07666821032762527,
"learning_rate": 2.745523078535517e-05,
"loss": 1.026611328125,
"step": 49
},
{
"epoch": 2.2727272727272725,
"grad_norm": 0.06852415204048157,
"learning_rate": 2.568823827750001e-05,
"loss": 1.045654296875,
"step": 50
},
{
"epoch": 2.3181818181818183,
"grad_norm": 0.07268761098384857,
"learning_rate": 2.39964886415941e-05,
"loss": 1.05419921875,
"step": 51
},
{
"epoch": 2.3636363636363638,
"grad_norm": 0.07941761612892151,
"learning_rate": 2.2384324574689612e-05,
"loss": 1.030029296875,
"step": 52
},
{
"epoch": 2.409090909090909,
"grad_norm": 0.06556671112775803,
"learning_rate": 2.0855884478824412e-05,
"loss": 1.0439453125,
"step": 53
},
{
"epoch": 2.409090909090909,
"eval_loss": 1.040771484375,
"eval_runtime": 5.1085,
"eval_samples_per_second": 0.783,
"eval_steps_per_second": 0.196,
"step": 53
},
{
"epoch": 2.4545454545454546,
"grad_norm": 0.0690130963921547,
"learning_rate": 1.9415091837803573e-05,
"loss": 1.046875,
"step": 54
},
{
"epoch": 2.5,
"grad_norm": 0.07252095639705658,
"learning_rate": 1.806564514567258e-05,
"loss": 1.015380859375,
"step": 55
},
{
"epoch": 2.5454545454545454,
"grad_norm": 0.07445185631513596,
"learning_rate": 1.6811008412736208e-05,
"loss": 1.06787109375,
"step": 56
},
{
"epoch": 2.590909090909091,
"grad_norm": 0.07511234283447266,
"learning_rate": 1.5654402273493805e-05,
"loss": 1.0625,
"step": 57
},
{
"epoch": 2.6363636363636362,
"grad_norm": 0.06960045546293259,
"learning_rate": 1.459879571931663e-05,
"loss": 1.047119140625,
"step": 58
},
{
"epoch": 2.6818181818181817,
"grad_norm": 0.07280787080526352,
"learning_rate": 1.3646898477089626e-05,
"loss": 1.0400390625,
"step": 59
},
{
"epoch": 2.7272727272727275,
"grad_norm": 0.07160894572734833,
"learning_rate": 1.2801154053381386e-05,
"loss": 1.046142578125,
"step": 60
},
{
"epoch": 2.7727272727272725,
"grad_norm": 0.06884549558162689,
"learning_rate": 1.2063733461997805e-05,
"loss": 1.048095703125,
"step": 61
},
{
"epoch": 2.8181818181818183,
"grad_norm": 0.07696957141160965,
"learning_rate": 1.1436529651020813e-05,
"loss": 1.02294921875,
"step": 62
},
{
"epoch": 2.8636363636363638,
"grad_norm": 0.06252304464578629,
"learning_rate": 1.092115264363775e-05,
"loss": 0.94873046875,
"step": 63
},
{
"epoch": 2.909090909090909,
"grad_norm": 0.0684686005115509,
"learning_rate": 1.0518925405234989e-05,
"loss": 1.083984375,
"step": 64
},
{
"epoch": 2.9545454545454546,
"grad_norm": 0.06993022561073303,
"learning_rate": 1.023088044736472e-05,
"loss": 1.02392578125,
"step": 65
},
{
"epoch": 3.0,
"grad_norm": 0.07079355418682098,
"learning_rate": 1.0057757177302627e-05,
"loss": 1.0322265625,
"step": 66
},
{
"epoch": 3.0,
"eval_loss": 1.032470703125,
"eval_runtime": 5.1167,
"eval_samples_per_second": 0.782,
"eval_steps_per_second": 0.195,
"step": 66
}
],
"logging_steps": 1.0,
"max_steps": 66,
"num_input_tokens_seen": 0,
"num_train_epochs": 3,
"save_steps": 0,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": true
},
"attributes": {}
}
},
"total_flos": 4.335415292244001e+18,
"train_batch_size": 1,
"trial_name": null,
"trial_params": null
}