adaption_math_misconception_match / trainer_state.json
Fernandosr85's picture
Add 11 files
7f2cb49 verified
Raw
History Blame Contribute Delete
13.1 kB
{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 3.0,
"eval_steps": 12,
"global_step": 63,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.047619047619047616,
"grad_norm": 26.258180618286133,
"learning_rate": 0.0,
"loss": 18.515625,
"step": 1
},
{
"epoch": 0.09523809523809523,
"grad_norm": 25.38199806213379,
"learning_rate": 2.5e-05,
"loss": 18.5859375,
"step": 2
},
{
"epoch": 0.14285714285714285,
"grad_norm": 18.595748901367188,
"learning_rate": 5e-05,
"loss": 16.6875,
"step": 3
},
{
"epoch": 0.19047619047619047,
"grad_norm": 9.914112091064453,
"learning_rate": 7.500000000000001e-05,
"loss": 12.1171875,
"step": 4
},
{
"epoch": 0.23809523809523808,
"grad_norm": 7.954200267791748,
"learning_rate": 0.0001,
"loss": 8.234375,
"step": 5
},
{
"epoch": 0.2857142857142857,
"grad_norm": 6.762725353240967,
"learning_rate": 9.99362213054543e-05,
"loss": 4.021484375,
"step": 6
},
{
"epoch": 0.3333333333333333,
"grad_norm": 4.886335849761963,
"learning_rate": 9.974506600945618e-05,
"loss": 1.10595703125,
"step": 7
},
{
"epoch": 0.38095238095238093,
"grad_norm": 1.199355125427246,
"learning_rate": 9.942707596246052e-05,
"loss": 0.357177734375,
"step": 8
},
{
"epoch": 0.42857142857142855,
"grad_norm": 0.6338489651679993,
"learning_rate": 9.8983152541804e-05,
"loss": 0.2091064453125,
"step": 9
},
{
"epoch": 0.47619047619047616,
"grad_norm": 0.19402951002120972,
"learning_rate": 9.841455409665323e-05,
"loss": 0.16455078125,
"step": 10
},
{
"epoch": 0.5238095238095238,
"grad_norm": 0.4312855005264282,
"learning_rate": 9.772289238107715e-05,
"loss": 0.17724609375,
"step": 11
},
{
"epoch": 0.5714285714285714,
"grad_norm": 0.20777462422847748,
"learning_rate": 9.691012798535524e-05,
"loss": 0.1539306640625,
"step": 12
},
{
"epoch": 0.6190476190476191,
"grad_norm": 0.6411371827125549,
"learning_rate": 9.59785647784711e-05,
"loss": 0.1865234375,
"step": 13
},
{
"epoch": 0.6666666666666666,
"grad_norm": 0.3755132853984833,
"learning_rate": 9.493084337754573e-05,
"loss": 0.154541015625,
"step": 14
},
{
"epoch": 0.7142857142857143,
"grad_norm": 0.21818028390407562,
"learning_rate": 9.376993366272128e-05,
"loss": 0.142333984375,
"step": 15
},
{
"epoch": 0.7142857142857143,
"eval_loss": 0.10693359375,
"eval_runtime": 2.2629,
"eval_samples_per_second": 0.442,
"eval_steps_per_second": 0.442,
"step": 15
},
{
"epoch": 0.7619047619047619,
"grad_norm": 0.3487852215766907,
"learning_rate": 9.249912635871318e-05,
"loss": 0.1746826171875,
"step": 16
},
{
"epoch": 0.8095238095238095,
"grad_norm": 0.16560474038124084,
"learning_rate": 9.112202370689337e-05,
"loss": 0.14697265625,
"step": 17
},
{
"epoch": 0.8571428571428571,
"grad_norm": 0.19229120016098022,
"learning_rate": 8.964252925434579e-05,
"loss": 0.15692138671875,
"step": 18
},
{
"epoch": 0.9047619047619048,
"grad_norm": 0.2123524695634842,
"learning_rate": 8.806483678883803e-05,
"loss": 0.15576171875,
"step": 19
},
{
"epoch": 0.9523809523809523,
"grad_norm": 0.15713752806186676,
"learning_rate": 8.639341845107433e-05,
"loss": 0.156982421875,
"step": 20
},
{
"epoch": 1.0,
"grad_norm": 0.038992200046777725,
"learning_rate": 8.463301205792675e-05,
"loss": 0.14178466796875,
"step": 21
},
{
"epoch": 1.0476190476190477,
"grad_norm": 0.09305933862924576,
"learning_rate": 8.278860767257865e-05,
"loss": 0.1387939453125,
"step": 22
},
{
"epoch": 1.0952380952380953,
"grad_norm": 0.1505240797996521,
"learning_rate": 8.086543345964832e-05,
"loss": 0.13616943359375,
"step": 23
},
{
"epoch": 1.1428571428571428,
"grad_norm": 0.18524615466594696,
"learning_rate": 7.886894086538841e-05,
"loss": 0.16064453125,
"step": 24
},
{
"epoch": 1.1904761904761905,
"grad_norm": 0.06549176573753357,
"learning_rate": 7.680478916496926e-05,
"loss": 0.131591796875,
"step": 25
},
{
"epoch": 1.2380952380952381,
"grad_norm": 0.11226853728294373,
"learning_rate": 7.46788294206485e-05,
"loss": 0.1463623046875,
"step": 26
},
{
"epoch": 1.2857142857142856,
"grad_norm": 0.23010337352752686,
"learning_rate": 7.249708789629944e-05,
"loss": 0.14068603515625,
"step": 27
},
{
"epoch": 1.2857142857142856,
"eval_loss": 0.10498046875,
"eval_runtime": 2.2511,
"eval_samples_per_second": 0.444,
"eval_steps_per_second": 0.444,
"step": 27
},
{
"epoch": 1.3333333333333333,
"grad_norm": 0.10772109776735306,
"learning_rate": 7.026574897531137e-05,
"loss": 0.14404296875,
"step": 28
},
{
"epoch": 1.380952380952381,
"grad_norm": 0.03903504088521004,
"learning_rate": 6.799113763028295e-05,
"loss": 0.14739990234375,
"step": 29
},
{
"epoch": 1.4285714285714286,
"grad_norm": 0.05378051847219467,
"learning_rate": 6.567970149420018e-05,
"loss": 0.13970947265625,
"step": 30
},
{
"epoch": 1.4761904761904763,
"grad_norm": 0.07061741501092911,
"learning_rate": 6.333799258392015e-05,
"loss": 0.1383056640625,
"step": 31
},
{
"epoch": 1.5238095238095237,
"grad_norm": 0.07531730085611343,
"learning_rate": 6.097264872776749e-05,
"loss": 0.1275634765625,
"step": 32
},
{
"epoch": 1.5714285714285714,
"grad_norm": 0.07265225052833557,
"learning_rate": 5.859037474988874e-05,
"loss": 0.135009765625,
"step": 33
},
{
"epoch": 1.619047619047619,
"grad_norm": 0.045906394720077515,
"learning_rate": 5.6197923464699875e-05,
"loss": 0.13372802734375,
"step": 34
},
{
"epoch": 1.6666666666666665,
"grad_norm": 0.05023833364248276,
"learning_rate": 5.3802076535300135e-05,
"loss": 0.12237548828125,
"step": 35
},
{
"epoch": 1.7142857142857144,
"grad_norm": 0.053686026483774185,
"learning_rate": 5.140962525011126e-05,
"loss": 0.12164306640625,
"step": 36
},
{
"epoch": 1.7619047619047619,
"grad_norm": 0.09860731661319733,
"learning_rate": 4.902735127223252e-05,
"loss": 0.14227294921875,
"step": 37
},
{
"epoch": 1.8095238095238095,
"grad_norm": 0.05519683286547661,
"learning_rate": 4.6662007416079864e-05,
"loss": 0.1280517578125,
"step": 38
},
{
"epoch": 1.8571428571428572,
"grad_norm": 0.09527605772018433,
"learning_rate": 4.432029850579983e-05,
"loss": 0.1417236328125,
"step": 39
},
{
"epoch": 1.8571428571428572,
"eval_loss": 0.08642578125,
"eval_runtime": 2.2488,
"eval_samples_per_second": 0.445,
"eval_steps_per_second": 0.445,
"step": 39
},
{
"epoch": 1.9047619047619047,
"grad_norm": 0.07749810069799423,
"learning_rate": 4.2008862369717074e-05,
"loss": 0.131103515625,
"step": 40
},
{
"epoch": 1.9523809523809523,
"grad_norm": 0.06240750476717949,
"learning_rate": 3.973425102468864e-05,
"loss": 0.14178466796875,
"step": 41
},
{
"epoch": 2.0,
"grad_norm": 0.05067940428853035,
"learning_rate": 3.750291210370057e-05,
"loss": 0.12774658203125,
"step": 42
},
{
"epoch": 2.0476190476190474,
"grad_norm": 0.05685904249548912,
"learning_rate": 3.5321170579351516e-05,
"loss": 0.12432861328125,
"step": 43
},
{
"epoch": 2.0952380952380953,
"grad_norm": 0.0624210424721241,
"learning_rate": 3.319521083503075e-05,
"loss": 0.11767578125,
"step": 44
},
{
"epoch": 2.142857142857143,
"grad_norm": 0.054149359464645386,
"learning_rate": 3.113105913461159e-05,
"loss": 0.13458251953125,
"step": 45
},
{
"epoch": 2.1904761904761907,
"grad_norm": 0.059766985476017,
"learning_rate": 2.9134566540351693e-05,
"loss": 0.12139892578125,
"step": 46
},
{
"epoch": 2.238095238095238,
"grad_norm": 0.055334560573101044,
"learning_rate": 2.721139232742137e-05,
"loss": 0.132080078125,
"step": 47
},
{
"epoch": 2.2857142857142856,
"grad_norm": 0.049609050154685974,
"learning_rate": 2.5366987942073267e-05,
"loss": 0.11822509765625,
"step": 48
},
{
"epoch": 2.3333333333333335,
"grad_norm": 0.06382595002651215,
"learning_rate": 2.3606581548925695e-05,
"loss": 0.13330078125,
"step": 49
},
{
"epoch": 2.380952380952381,
"grad_norm": 0.06832896173000336,
"learning_rate": 2.1935163211161985e-05,
"loss": 0.13916015625,
"step": 50
},
{
"epoch": 2.4285714285714284,
"grad_norm": 0.041778020560741425,
"learning_rate": 2.0357470745654214e-05,
"loss": 0.13079833984375,
"step": 51
},
{
"epoch": 2.4285714285714284,
"eval_loss": 0.087890625,
"eval_runtime": 2.2521,
"eval_samples_per_second": 0.444,
"eval_steps_per_second": 0.444,
"step": 51
},
{
"epoch": 2.4761904761904763,
"grad_norm": 0.047971971333026886,
"learning_rate": 1.8877976293106646e-05,
"loss": 0.1259765625,
"step": 52
},
{
"epoch": 2.5238095238095237,
"grad_norm": 0.06257976591587067,
"learning_rate": 1.7500873641286825e-05,
"loss": 0.11712646484375,
"step": 53
},
{
"epoch": 2.571428571428571,
"grad_norm": 0.05711723119020462,
"learning_rate": 1.6230066337278724e-05,
"loss": 0.12890625,
"step": 54
},
{
"epoch": 2.619047619047619,
"grad_norm": 0.06507477164268494,
"learning_rate": 1.5069156622454287e-05,
"loss": 0.12548828125,
"step": 55
},
{
"epoch": 2.6666666666666665,
"grad_norm": 0.04118900001049042,
"learning_rate": 1.4021435221528906e-05,
"loss": 0.1136474609375,
"step": 56
},
{
"epoch": 2.7142857142857144,
"grad_norm": 0.07443732768297195,
"learning_rate": 1.3089872014644771e-05,
"loss": 0.113037109375,
"step": 57
},
{
"epoch": 2.761904761904762,
"grad_norm": 0.06563269346952438,
"learning_rate": 1.2277107618922843e-05,
"loss": 0.12896728515625,
"step": 58
},
{
"epoch": 2.8095238095238093,
"grad_norm": 0.04780431464314461,
"learning_rate": 1.1585445903346783e-05,
"loss": 0.117431640625,
"step": 59
},
{
"epoch": 2.857142857142857,
"grad_norm": 0.0709613487124443,
"learning_rate": 1.1016847458196001e-05,
"loss": 0.13092041015625,
"step": 60
},
{
"epoch": 2.9047619047619047,
"grad_norm": 0.10224345326423645,
"learning_rate": 1.0572924037539496e-05,
"loss": 0.125,
"step": 61
},
{
"epoch": 2.9523809523809526,
"grad_norm": 0.07073601335287094,
"learning_rate": 1.0254933990543831e-05,
"loss": 0.13189697265625,
"step": 62
},
{
"epoch": 3.0,
"grad_norm": 0.0436314195394516,
"learning_rate": 1.0063778694545714e-05,
"loss": 0.117919921875,
"step": 63
},
{
"epoch": 3.0,
"eval_loss": 0.08203125,
"eval_runtime": 2.2583,
"eval_samples_per_second": 0.443,
"eval_steps_per_second": 0.443,
"step": 63
}
],
"logging_steps": 1.0,
"max_steps": 63,
"num_input_tokens_seen": 0,
"num_train_epochs": 3,
"save_steps": 0,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": true
},
"attributes": {}
}
},
"total_flos": 1.365649123801301e+18,
"train_batch_size": 1,
"trial_name": null,
"trial_params": null
}