tiny-aya-agent / checkpoint-60 /trainer_state.json
ferscm44's picture
Upload folder using huggingface_hub
7170091 verified
Raw
History Blame Contribute Delete
18.2 kB
{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 3.0,
"eval_steps": 500,
"global_step": 60,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"entropy": 0.3058870881795883,
"epoch": 0.05063291139240506,
"grad_norm": 1.2109375,
"learning_rate": 0.0,
"loss": 0.8967164754867554,
"mean_token_accuracy": 0.7853250801563263,
"num_tokens": 4094.0,
"step": 1
},
{
"entropy": 0.2770821340382099,
"epoch": 0.10126582278481013,
"grad_norm": 1.1953125,
"learning_rate": 4e-05,
"loss": 0.8378055095672607,
"mean_token_accuracy": 0.8762781769037247,
"num_tokens": 8270.0,
"step": 2
},
{
"entropy": 0.33289381861686707,
"epoch": 0.1518987341772152,
"grad_norm": 2.28125,
"learning_rate": 8e-05,
"loss": 1.3381309509277344,
"mean_token_accuracy": 0.8489641100168228,
"num_tokens": 12538.0,
"step": 3
},
{
"entropy": 0.2396358586847782,
"epoch": 0.20253164556962025,
"grad_norm": 0.8125,
"learning_rate": 0.00012,
"loss": 0.4996604919433594,
"mean_token_accuracy": 0.9098183065652847,
"num_tokens": 16803.0,
"step": 4
},
{
"entropy": 0.3024279847741127,
"epoch": 0.25316455696202533,
"grad_norm": 1.015625,
"learning_rate": 0.00016,
"loss": 0.57768714427948,
"mean_token_accuracy": 0.8811647891998291,
"num_tokens": 21541.0,
"step": 5
},
{
"entropy": 0.2746536508202553,
"epoch": 0.3037974683544304,
"grad_norm": 0.84375,
"learning_rate": 0.0002,
"loss": 0.2727876305580139,
"mean_token_accuracy": 0.925768256187439,
"num_tokens": 25660.0,
"step": 6
},
{
"entropy": 0.21791627258062363,
"epoch": 0.35443037974683544,
"grad_norm": 0.515625,
"learning_rate": 0.00019636363636363636,
"loss": 0.13589006662368774,
"mean_token_accuracy": 0.9386249780654907,
"num_tokens": 29675.0,
"step": 7
},
{
"entropy": 0.23072286322712898,
"epoch": 0.4050632911392405,
"grad_norm": 0.66796875,
"learning_rate": 0.00019272727272727274,
"loss": 0.22619852423667908,
"mean_token_accuracy": 0.9601024985313416,
"num_tokens": 33786.0,
"step": 8
},
{
"entropy": 0.12776251882314682,
"epoch": 0.45569620253164556,
"grad_norm": 0.3359375,
"learning_rate": 0.0001890909090909091,
"loss": 0.12999381124973297,
"mean_token_accuracy": 0.964403823018074,
"num_tokens": 38029.0,
"step": 9
},
{
"entropy": 0.15997863747179508,
"epoch": 0.5063291139240507,
"grad_norm": 0.380859375,
"learning_rate": 0.00018545454545454545,
"loss": 0.1289505809545517,
"mean_token_accuracy": 0.9806439429521561,
"num_tokens": 41940.0,
"step": 10
},
{
"entropy": 0.17812986858189106,
"epoch": 0.5569620253164557,
"grad_norm": 0.6328125,
"learning_rate": 0.00018181818181818183,
"loss": 0.09373250603675842,
"mean_token_accuracy": 0.9405141770839691,
"num_tokens": 45774.0,
"step": 11
},
{
"entropy": 0.12172849662601948,
"epoch": 0.6075949367088608,
"grad_norm": 0.2177734375,
"learning_rate": 0.0001781818181818182,
"loss": 0.03453471511602402,
"mean_token_accuracy": 1.0,
"num_tokens": 49748.0,
"step": 12
},
{
"entropy": 0.18016426265239716,
"epoch": 0.6582278481012658,
"grad_norm": 0.28125,
"learning_rate": 0.00017454545454545454,
"loss": 0.156061589717865,
"mean_token_accuracy": 0.9543326944112778,
"num_tokens": 54197.0,
"step": 13
},
{
"entropy": 0.13954658806324005,
"epoch": 0.7088607594936709,
"grad_norm": 0.296875,
"learning_rate": 0.0001709090909090909,
"loss": 0.10283268988132477,
"mean_token_accuracy": 0.9802946299314499,
"num_tokens": 58556.0,
"step": 14
},
{
"entropy": 0.08406208734959364,
"epoch": 0.759493670886076,
"grad_norm": 0.5234375,
"learning_rate": 0.00016727272727272728,
"loss": 0.057560667395591736,
"mean_token_accuracy": 0.9583040475845337,
"num_tokens": 62314.0,
"step": 15
},
{
"entropy": 0.14593530632555485,
"epoch": 0.810126582278481,
"grad_norm": 0.2890625,
"learning_rate": 0.00016363636363636366,
"loss": 0.13262268900871277,
"mean_token_accuracy": 0.9821915328502655,
"num_tokens": 66709.0,
"step": 16
},
{
"entropy": 0.12713714689016342,
"epoch": 0.8607594936708861,
"grad_norm": 0.232421875,
"learning_rate": 0.00016,
"loss": 0.098836250603199,
"mean_token_accuracy": 0.9742450714111328,
"num_tokens": 71033.0,
"step": 17
},
{
"entropy": 0.07605009153485298,
"epoch": 0.9113924050632911,
"grad_norm": 0.275390625,
"learning_rate": 0.00015636363636363637,
"loss": 0.06675960123538971,
"mean_token_accuracy": 0.9730987101793289,
"num_tokens": 75240.0,
"step": 18
},
{
"entropy": 0.08511319197714329,
"epoch": 0.9620253164556962,
"grad_norm": 0.251953125,
"learning_rate": 0.00015272727272727275,
"loss": 0.06137944757938385,
"mean_token_accuracy": 0.9560078978538513,
"num_tokens": 79484.0,
"step": 19
},
{
"entropy": 0.09591637427608173,
"epoch": 1.0,
"grad_norm": 0.1982421875,
"learning_rate": 0.0001490909090909091,
"loss": 0.09518605470657349,
"mean_token_accuracy": 0.9860279361406962,
"num_tokens": 82572.0,
"step": 20
},
{
"entropy": 0.09083444299176335,
"epoch": 1.0506329113924051,
"grad_norm": 0.2294921875,
"learning_rate": 0.00014545454545454546,
"loss": 0.06781512498855591,
"mean_token_accuracy": 0.9847126454114914,
"num_tokens": 87051.0,
"step": 21
},
{
"entropy": 0.07092627324163914,
"epoch": 1.1012658227848102,
"grad_norm": 0.1875,
"learning_rate": 0.00014181818181818184,
"loss": 0.051979709416627884,
"mean_token_accuracy": 0.9823355972766876,
"num_tokens": 91753.0,
"step": 22
},
{
"entropy": 0.05573681928217411,
"epoch": 1.1518987341772151,
"grad_norm": 0.373046875,
"learning_rate": 0.0001381818181818182,
"loss": 0.04127391055226326,
"mean_token_accuracy": 0.9915009140968323,
"num_tokens": 95997.0,
"step": 23
},
{
"entropy": 0.06601053988561034,
"epoch": 1.2025316455696202,
"grad_norm": 0.1669921875,
"learning_rate": 0.00013454545454545455,
"loss": 0.029800206422805786,
"mean_token_accuracy": 0.99110147356987,
"num_tokens": 100340.0,
"step": 24
},
{
"entropy": 0.06689108535647392,
"epoch": 1.2531645569620253,
"grad_norm": 0.1572265625,
"learning_rate": 0.00013090909090909093,
"loss": 0.03818785399198532,
"mean_token_accuracy": 0.98154416680336,
"num_tokens": 104255.0,
"step": 25
},
{
"entropy": 0.11440154490992427,
"epoch": 1.3037974683544304,
"grad_norm": 0.197265625,
"learning_rate": 0.00012727272727272728,
"loss": 0.07071410864591599,
"mean_token_accuracy": 0.9655913859605789,
"num_tokens": 108510.0,
"step": 26
},
{
"entropy": 0.05173112731426954,
"epoch": 1.3544303797468356,
"grad_norm": 0.181640625,
"learning_rate": 0.00012363636363636364,
"loss": 0.04332485422492027,
"mean_token_accuracy": 0.9889708757400513,
"num_tokens": 112648.0,
"step": 27
},
{
"entropy": 0.11879035737365484,
"epoch": 1.4050632911392404,
"grad_norm": 0.2890625,
"learning_rate": 0.00012,
"loss": 0.030448323115706444,
"mean_token_accuracy": 0.9249999970197678,
"num_tokens": 116428.0,
"step": 28
},
{
"entropy": 0.04456495773047209,
"epoch": 1.4556962025316456,
"grad_norm": 0.263671875,
"learning_rate": 0.00011636363636363636,
"loss": 0.026923775672912598,
"mean_token_accuracy": 0.9970930218696594,
"num_tokens": 120223.0,
"step": 29
},
{
"entropy": 0.05467428918927908,
"epoch": 1.5063291139240507,
"grad_norm": 0.30078125,
"learning_rate": 0.00011272727272727272,
"loss": 0.05243736505508423,
"mean_token_accuracy": 0.9819361567497253,
"num_tokens": 124463.0,
"step": 30
},
{
"entropy": 0.12604457885026932,
"epoch": 1.5569620253164556,
"grad_norm": 0.232421875,
"learning_rate": 0.00010909090909090909,
"loss": 0.09929254651069641,
"mean_token_accuracy": 0.9316810220479965,
"num_tokens": 128541.0,
"step": 31
},
{
"entropy": 0.05706793861463666,
"epoch": 1.6075949367088609,
"grad_norm": 0.1513671875,
"learning_rate": 0.00010545454545454545,
"loss": 0.06422308087348938,
"mean_token_accuracy": 0.986874520778656,
"num_tokens": 133117.0,
"step": 32
},
{
"entropy": 0.07498226407915354,
"epoch": 1.6582278481012658,
"grad_norm": 0.21484375,
"learning_rate": 0.00010181818181818181,
"loss": 0.0917193740606308,
"mean_token_accuracy": 0.9649497419595718,
"num_tokens": 137164.0,
"step": 33
},
{
"entropy": 0.04969165986403823,
"epoch": 1.7088607594936709,
"grad_norm": 0.1845703125,
"learning_rate": 9.818181818181818e-05,
"loss": 0.03874623030424118,
"mean_token_accuracy": 0.9855220764875412,
"num_tokens": 141297.0,
"step": 34
},
{
"entropy": 0.059562995098531246,
"epoch": 1.759493670886076,
"grad_norm": 0.234375,
"learning_rate": 9.454545454545455e-05,
"loss": 0.07269799709320068,
"mean_token_accuracy": 0.9904753267765045,
"num_tokens": 145157.0,
"step": 35
},
{
"entropy": 0.06618588929995894,
"epoch": 1.810126582278481,
"grad_norm": 0.154296875,
"learning_rate": 9.090909090909092e-05,
"loss": 0.05096203833818436,
"mean_token_accuracy": 0.9642254859209061,
"num_tokens": 149499.0,
"step": 36
},
{
"entropy": 0.06980292382650077,
"epoch": 1.8607594936708862,
"grad_norm": 0.2080078125,
"learning_rate": 8.727272727272727e-05,
"loss": 0.015605948865413666,
"mean_token_accuracy": 0.9749999940395355,
"num_tokens": 153413.0,
"step": 37
},
{
"entropy": 0.0673763882368803,
"epoch": 1.9113924050632911,
"grad_norm": 0.56640625,
"learning_rate": 8.363636363636364e-05,
"loss": 0.12869100272655487,
"mean_token_accuracy": 0.9618695080280304,
"num_tokens": 157547.0,
"step": 38
},
{
"entropy": 0.04205051809549332,
"epoch": 1.9620253164556962,
"grad_norm": 0.1533203125,
"learning_rate": 8e-05,
"loss": 0.051324643194675446,
"mean_token_accuracy": 0.9915735274553299,
"num_tokens": 161912.0,
"step": 39
},
{
"entropy": 0.03731320612132549,
"epoch": 2.0,
"grad_norm": 0.15234375,
"learning_rate": 7.636363636363637e-05,
"loss": 0.03378448635339737,
"mean_token_accuracy": 0.9946303764979044,
"num_tokens": 165144.0,
"step": 40
},
{
"entropy": 0.07533124275505543,
"epoch": 2.050632911392405,
"grad_norm": 0.216796875,
"learning_rate": 7.272727272727273e-05,
"loss": 0.04694521799683571,
"mean_token_accuracy": 0.9949748814105988,
"num_tokens": 169344.0,
"step": 41
},
{
"entropy": 0.045258086174726486,
"epoch": 2.1012658227848102,
"grad_norm": 0.158203125,
"learning_rate": 6.90909090909091e-05,
"loss": 0.03484552353620529,
"mean_token_accuracy": 0.9914986789226532,
"num_tokens": 173572.0,
"step": 42
},
{
"entropy": 0.05962226795963943,
"epoch": 2.151898734177215,
"grad_norm": 0.15234375,
"learning_rate": 6.545454545454546e-05,
"loss": 0.05552398040890694,
"mean_token_accuracy": 0.9867942631244659,
"num_tokens": 178049.0,
"step": 43
},
{
"entropy": 0.04453732492402196,
"epoch": 2.2025316455696204,
"grad_norm": 0.25,
"learning_rate": 6.181818181818182e-05,
"loss": 0.07184948027133942,
"mean_token_accuracy": 0.9885145127773285,
"num_tokens": 182147.0,
"step": 44
},
{
"entropy": 0.036392109002918005,
"epoch": 2.2531645569620253,
"grad_norm": 0.26953125,
"learning_rate": 5.818181818181818e-05,
"loss": 0.028611719608306885,
"mean_token_accuracy": 0.9898450970649719,
"num_tokens": 186075.0,
"step": 45
},
{
"entropy": 0.046361514599993825,
"epoch": 2.3037974683544302,
"grad_norm": 0.1630859375,
"learning_rate": 5.4545454545454546e-05,
"loss": 0.02000986412167549,
"mean_token_accuracy": 0.9895833283662796,
"num_tokens": 189736.0,
"step": 46
},
{
"entropy": 0.059202448232099414,
"epoch": 2.3544303797468356,
"grad_norm": 0.2216796875,
"learning_rate": 5.090909090909091e-05,
"loss": 0.03575129061937332,
"mean_token_accuracy": 0.9949752688407898,
"num_tokens": 194069.0,
"step": 47
},
{
"entropy": 0.0532573452219367,
"epoch": 2.4050632911392404,
"grad_norm": 0.13671875,
"learning_rate": 4.7272727272727275e-05,
"loss": 0.037198036909103394,
"mean_token_accuracy": 0.9947335422039032,
"num_tokens": 198435.0,
"step": 48
},
{
"entropy": 0.046060606604442,
"epoch": 2.4556962025316453,
"grad_norm": 0.171875,
"learning_rate": 4.3636363636363636e-05,
"loss": 0.0407770499587059,
"mean_token_accuracy": 0.9934192597866058,
"num_tokens": 202365.0,
"step": 49
},
{
"entropy": 0.051424249075353146,
"epoch": 2.5063291139240507,
"grad_norm": 0.2353515625,
"learning_rate": 4e-05,
"loss": 0.04629915952682495,
"mean_token_accuracy": 0.9804457575082779,
"num_tokens": 206300.0,
"step": 50
},
{
"entropy": 0.05351645685732365,
"epoch": 2.5569620253164556,
"grad_norm": 0.1474609375,
"learning_rate": 3.6363636363636364e-05,
"loss": 0.03186073899269104,
"mean_token_accuracy": 0.9686382859945297,
"num_tokens": 210440.0,
"step": 51
},
{
"entropy": 0.0505744197871536,
"epoch": 2.607594936708861,
"grad_norm": 0.1328125,
"learning_rate": 3.272727272727273e-05,
"loss": 0.034618668258190155,
"mean_token_accuracy": 0.9690476208925247,
"num_tokens": 214755.0,
"step": 52
},
{
"entropy": 0.09076045430265367,
"epoch": 2.6582278481012658,
"grad_norm": 0.1123046875,
"learning_rate": 2.909090909090909e-05,
"loss": 0.03738842159509659,
"mean_token_accuracy": 0.9946236610412598,
"num_tokens": 219052.0,
"step": 53
},
{
"entropy": 0.03509035054594278,
"epoch": 2.708860759493671,
"grad_norm": 0.09716796875,
"learning_rate": 2.5454545454545454e-05,
"loss": 0.017466925084590912,
"mean_token_accuracy": 0.9951923042535782,
"num_tokens": 223211.0,
"step": 54
},
{
"entropy": 0.03864420251920819,
"epoch": 2.759493670886076,
"grad_norm": 0.10595703125,
"learning_rate": 2.1818181818181818e-05,
"loss": 0.023350555449724197,
"mean_token_accuracy": 0.9902347922325134,
"num_tokens": 227258.0,
"step": 55
},
{
"entropy": 0.06260875472798944,
"epoch": 2.810126582278481,
"grad_norm": 0.2333984375,
"learning_rate": 1.8181818181818182e-05,
"loss": 0.06964948028326035,
"mean_token_accuracy": 0.9637512564659119,
"num_tokens": 231368.0,
"step": 56
},
{
"entropy": 0.03902584942989051,
"epoch": 2.8607594936708862,
"grad_norm": 0.08447265625,
"learning_rate": 1.4545454545454545e-05,
"loss": 0.026787985116243362,
"mean_token_accuracy": 0.9909819066524506,
"num_tokens": 235881.0,
"step": 57
},
{
"entropy": 0.026682122610509396,
"epoch": 2.911392405063291,
"grad_norm": 0.1455078125,
"learning_rate": 1.0909090909090909e-05,
"loss": 0.017513107508420944,
"mean_token_accuracy": 0.9918909966945648,
"num_tokens": 240330.0,
"step": 58
},
{
"entropy": 0.02819057530723512,
"epoch": 2.962025316455696,
"grad_norm": 0.126953125,
"learning_rate": 7.272727272727272e-06,
"loss": 0.016973333433270454,
"mean_token_accuracy": 0.9969512224197388,
"num_tokens": 244397.0,
"step": 59
},
{
"entropy": 0.09315565973520279,
"epoch": 3.0,
"grad_norm": 0.1376953125,
"learning_rate": 3.636363636363636e-06,
"loss": 0.037921059876680374,
"mean_token_accuracy": 0.9591470758120219,
"num_tokens": 247716.0,
"step": 60
}
],
"logging_steps": 1,
"max_steps": 60,
"num_input_tokens_seen": 0,
"num_train_epochs": 3,
"save_steps": 500,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": true
},
"attributes": {}
}
},
"total_flos": 4269851314864128.0,
"train_batch_size": 1,
"trial_name": null,
"trial_params": null
}