adaption_agronomy_calc_problems / trainer_state.json
manifesta's picture
Add 11 files
acea658 verified
Raw
History Blame Contribute Delete
13.5 kB
{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 3.0,
"eval_steps": 13,
"global_step": 66,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.045454545454545456,
"grad_norm": 2.6548092365264893,
"learning_rate": 0.0,
"loss": 1.6435546875,
"step": 1
},
{
"epoch": 0.09090909090909091,
"grad_norm": 2.1871001720428467,
"learning_rate": 1.4285714285714285e-05,
"loss": 1.658203125,
"step": 2
},
{
"epoch": 0.13636363636363635,
"grad_norm": 2.062452554702759,
"learning_rate": 2.857142857142857e-05,
"loss": 1.6513671875,
"step": 3
},
{
"epoch": 0.18181818181818182,
"grad_norm": 2.1208860874176025,
"learning_rate": 4.2857142857142856e-05,
"loss": 1.79296875,
"step": 4
},
{
"epoch": 0.22727272727272727,
"grad_norm": 2.061913013458252,
"learning_rate": 5.714285714285714e-05,
"loss": 1.7509765625,
"step": 5
},
{
"epoch": 0.2727272727272727,
"grad_norm": 1.7802969217300415,
"learning_rate": 7.142857142857143e-05,
"loss": 1.5673828125,
"step": 6
},
{
"epoch": 0.3181818181818182,
"grad_norm": 1.2095720767974854,
"learning_rate": 8.571428571428571e-05,
"loss": 1.306640625,
"step": 7
},
{
"epoch": 0.36363636363636365,
"grad_norm": 0.9277960658073425,
"learning_rate": 0.0001,
"loss": 1.5087890625,
"step": 8
},
{
"epoch": 0.4090909090909091,
"grad_norm": 0.422941118478775,
"learning_rate": 9.99362213054543e-05,
"loss": 1.28564453125,
"step": 9
},
{
"epoch": 0.45454545454545453,
"grad_norm": 0.4278399646282196,
"learning_rate": 9.974506600945618e-05,
"loss": 1.15869140625,
"step": 10
},
{
"epoch": 0.5,
"grad_norm": 0.5854852199554443,
"learning_rate": 9.942707596246052e-05,
"loss": 1.2158203125,
"step": 11
},
{
"epoch": 0.5454545454545454,
"grad_norm": 0.6278713941574097,
"learning_rate": 9.8983152541804e-05,
"loss": 1.11083984375,
"step": 12
},
{
"epoch": 0.5909090909090909,
"grad_norm": 0.5748578906059265,
"learning_rate": 9.841455409665323e-05,
"loss": 1.12744140625,
"step": 13
},
{
"epoch": 0.6363636363636364,
"grad_norm": 0.512302577495575,
"learning_rate": 9.772289238107715e-05,
"loss": 1.142822265625,
"step": 14
},
{
"epoch": 0.6363636363636364,
"eval_loss": 1.291748046875,
"eval_runtime": 2.5876,
"eval_samples_per_second": 0.773,
"eval_steps_per_second": 0.386,
"step": 14
},
{
"epoch": 0.6818181818181818,
"grad_norm": 0.4575030207633972,
"learning_rate": 9.691012798535524e-05,
"loss": 1.03515625,
"step": 15
},
{
"epoch": 0.7272727272727273,
"grad_norm": 0.43149498105049133,
"learning_rate": 9.59785647784711e-05,
"loss": 1.15673828125,
"step": 16
},
{
"epoch": 0.7727272727272727,
"grad_norm": 0.3845219016075134,
"learning_rate": 9.493084337754573e-05,
"loss": 1.15966796875,
"step": 17
},
{
"epoch": 0.8181818181818182,
"grad_norm": 0.3182738125324249,
"learning_rate": 9.376993366272128e-05,
"loss": 1.005126953125,
"step": 18
},
{
"epoch": 0.8636363636363636,
"grad_norm": 0.26902279257774353,
"learning_rate": 9.249912635871318e-05,
"loss": 0.90478515625,
"step": 19
},
{
"epoch": 0.9090909090909091,
"grad_norm": 0.2571004629135132,
"learning_rate": 9.112202370689337e-05,
"loss": 1.18798828125,
"step": 20
},
{
"epoch": 0.9545454545454546,
"grad_norm": 0.22165662050247192,
"learning_rate": 8.964252925434579e-05,
"loss": 1.18212890625,
"step": 21
},
{
"epoch": 1.0,
"grad_norm": 0.22131846845149994,
"learning_rate": 8.806483678883803e-05,
"loss": 1.0927734375,
"step": 22
},
{
"epoch": 1.0454545454545454,
"grad_norm": 0.22180692851543427,
"learning_rate": 8.639341845107433e-05,
"loss": 0.904296875,
"step": 23
},
{
"epoch": 1.0909090909090908,
"grad_norm": 0.1869996339082718,
"learning_rate": 8.463301205792675e-05,
"loss": 1.0166015625,
"step": 24
},
{
"epoch": 1.1363636363636362,
"grad_norm": 0.1848447024822235,
"learning_rate": 8.278860767257865e-05,
"loss": 1.04736328125,
"step": 25
},
{
"epoch": 1.1818181818181819,
"grad_norm": 0.18901988863945007,
"learning_rate": 8.086543345964832e-05,
"loss": 1.13818359375,
"step": 26
},
{
"epoch": 1.2272727272727273,
"grad_norm": 0.18062233924865723,
"learning_rate": 7.886894086538841e-05,
"loss": 1.14208984375,
"step": 27
},
{
"epoch": 1.2272727272727273,
"eval_loss": 1.1639404296875,
"eval_runtime": 2.5708,
"eval_samples_per_second": 0.778,
"eval_steps_per_second": 0.389,
"step": 27
},
{
"epoch": 1.2727272727272727,
"grad_norm": 0.15816649794578552,
"learning_rate": 7.680478916496926e-05,
"loss": 1.048828125,
"step": 28
},
{
"epoch": 1.3181818181818181,
"grad_norm": 0.14896328747272491,
"learning_rate": 7.46788294206485e-05,
"loss": 0.94775390625,
"step": 29
},
{
"epoch": 1.3636363636363638,
"grad_norm": 0.1636885106563568,
"learning_rate": 7.249708789629944e-05,
"loss": 1.25439453125,
"step": 30
},
{
"epoch": 1.4090909090909092,
"grad_norm": 0.14491912722587585,
"learning_rate": 7.026574897531137e-05,
"loss": 1.07958984375,
"step": 31
},
{
"epoch": 1.4545454545454546,
"grad_norm": 0.14638982713222504,
"learning_rate": 6.799113763028295e-05,
"loss": 0.95654296875,
"step": 32
},
{
"epoch": 1.5,
"grad_norm": 0.1446317881345749,
"learning_rate": 6.567970149420018e-05,
"loss": 1.0166015625,
"step": 33
},
{
"epoch": 1.5454545454545454,
"grad_norm": 0.1534801572561264,
"learning_rate": 6.333799258392015e-05,
"loss": 0.9140625,
"step": 34
},
{
"epoch": 1.5909090909090908,
"grad_norm": 0.13671812415122986,
"learning_rate": 6.097264872776749e-05,
"loss": 0.966796875,
"step": 35
},
{
"epoch": 1.6363636363636362,
"grad_norm": 0.10513126850128174,
"learning_rate": 5.859037474988874e-05,
"loss": 1.013671875,
"step": 36
},
{
"epoch": 1.6818181818181817,
"grad_norm": 0.10856485366821289,
"learning_rate": 5.6197923464699875e-05,
"loss": 0.8955078125,
"step": 37
},
{
"epoch": 1.7272727272727273,
"grad_norm": 0.10285820811986923,
"learning_rate": 5.3802076535300135e-05,
"loss": 1.03466796875,
"step": 38
},
{
"epoch": 1.7727272727272727,
"grad_norm": 0.11110834032297134,
"learning_rate": 5.140962525011126e-05,
"loss": 1.033203125,
"step": 39
},
{
"epoch": 1.8181818181818183,
"grad_norm": 0.12622413039207458,
"learning_rate": 4.902735127223252e-05,
"loss": 0.872802734375,
"step": 40
},
{
"epoch": 1.8181818181818183,
"eval_loss": 1.1239013671875,
"eval_runtime": 2.5733,
"eval_samples_per_second": 0.777,
"eval_steps_per_second": 0.389,
"step": 40
},
{
"epoch": 1.8636363636363638,
"grad_norm": 0.14194338023662567,
"learning_rate": 4.6662007416079864e-05,
"loss": 0.77783203125,
"step": 41
},
{
"epoch": 1.9090909090909092,
"grad_norm": 0.1279911994934082,
"learning_rate": 4.432029850579983e-05,
"loss": 1.11865234375,
"step": 42
},
{
"epoch": 1.9545454545454546,
"grad_norm": 0.1066598892211914,
"learning_rate": 4.2008862369717074e-05,
"loss": 1.10205078125,
"step": 43
},
{
"epoch": 2.0,
"grad_norm": 0.10433182120323181,
"learning_rate": 3.973425102468864e-05,
"loss": 0.99658203125,
"step": 44
},
{
"epoch": 2.0454545454545454,
"grad_norm": 0.13041560351848602,
"learning_rate": 3.750291210370057e-05,
"loss": 0.7978515625,
"step": 45
},
{
"epoch": 2.090909090909091,
"grad_norm": 0.09705521911382675,
"learning_rate": 3.5321170579351516e-05,
"loss": 0.93994140625,
"step": 46
},
{
"epoch": 2.1363636363636362,
"grad_norm": 0.09956496208906174,
"learning_rate": 3.319521083503075e-05,
"loss": 0.984375,
"step": 47
},
{
"epoch": 2.1818181818181817,
"grad_norm": 0.09361614286899567,
"learning_rate": 3.113105913461159e-05,
"loss": 1.08203125,
"step": 48
},
{
"epoch": 2.227272727272727,
"grad_norm": 0.10508329421281815,
"learning_rate": 2.9134566540351693e-05,
"loss": 1.0947265625,
"step": 49
},
{
"epoch": 2.2727272727272725,
"grad_norm": 0.09553074091672897,
"learning_rate": 2.721139232742137e-05,
"loss": 0.98388671875,
"step": 50
},
{
"epoch": 2.3181818181818183,
"grad_norm": 0.10687677562236786,
"learning_rate": 2.5366987942073267e-05,
"loss": 0.8876953125,
"step": 51
},
{
"epoch": 2.3636363636363638,
"grad_norm": 0.1090177521109581,
"learning_rate": 2.3606581548925695e-05,
"loss": 1.20703125,
"step": 52
},
{
"epoch": 2.409090909090909,
"grad_norm": 0.11122502386569977,
"learning_rate": 2.1935163211161985e-05,
"loss": 1.0263671875,
"step": 53
},
{
"epoch": 2.409090909090909,
"eval_loss": 1.099853515625,
"eval_runtime": 2.5655,
"eval_samples_per_second": 0.78,
"eval_steps_per_second": 0.39,
"step": 53
},
{
"epoch": 2.4545454545454546,
"grad_norm": 0.10583138465881348,
"learning_rate": 2.0357470745654214e-05,
"loss": 0.89794921875,
"step": 54
},
{
"epoch": 2.5,
"grad_norm": 0.1000722348690033,
"learning_rate": 1.8877976293106646e-05,
"loss": 0.9599609375,
"step": 55
},
{
"epoch": 2.5454545454545454,
"grad_norm": 0.10857231914997101,
"learning_rate": 1.7500873641286825e-05,
"loss": 0.8583984375,
"step": 56
},
{
"epoch": 2.590909090909091,
"grad_norm": 0.0891537070274353,
"learning_rate": 1.6230066337278724e-05,
"loss": 0.923828125,
"step": 57
},
{
"epoch": 2.6363636363636362,
"grad_norm": 0.08360682427883148,
"learning_rate": 1.5069156622454287e-05,
"loss": 0.983642578125,
"step": 58
},
{
"epoch": 2.6818181818181817,
"grad_norm": 0.08480792492628098,
"learning_rate": 1.4021435221528906e-05,
"loss": 0.86181640625,
"step": 59
},
{
"epoch": 2.7272727272727275,
"grad_norm": 0.07951804250478745,
"learning_rate": 1.3089872014644771e-05,
"loss": 1.0068359375,
"step": 60
},
{
"epoch": 2.7727272727272725,
"grad_norm": 0.08608327805995941,
"learning_rate": 1.2277107618922843e-05,
"loss": 1.00048828125,
"step": 61
},
{
"epoch": 2.8181818181818183,
"grad_norm": 0.1031343936920166,
"learning_rate": 1.1585445903346783e-05,
"loss": 0.836669921875,
"step": 62
},
{
"epoch": 2.8636363636363638,
"grad_norm": 0.1224270910024643,
"learning_rate": 1.1016847458196001e-05,
"loss": 0.7412109375,
"step": 63
},
{
"epoch": 2.909090909090909,
"grad_norm": 0.10332220047712326,
"learning_rate": 1.0572924037539496e-05,
"loss": 1.10009765625,
"step": 64
},
{
"epoch": 2.9545454545454546,
"grad_norm": 0.08486974984407425,
"learning_rate": 1.0254933990543831e-05,
"loss": 1.078125,
"step": 65
},
{
"epoch": 3.0,
"grad_norm": 0.08661636710166931,
"learning_rate": 1.0063778694545714e-05,
"loss": 0.97265625,
"step": 66
},
{
"epoch": 3.0,
"eval_loss": 1.0919189453125,
"eval_runtime": 2.5707,
"eval_samples_per_second": 0.778,
"eval_steps_per_second": 0.389,
"step": 66
}
],
"logging_steps": 1.0,
"max_steps": 66,
"num_input_tokens_seen": 0,
"num_train_epochs": 3,
"save_steps": 0,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": true
},
"attributes": {}
}
},
"total_flos": 1.339633585618944e+18,
"train_batch_size": 1,
"trial_name": null,
"trial_params": null
}