adaption_adapt_market_analysis / trainer_state.json
Mikkkkoooo's picture
Add 11 files
e19ba44 verified
Raw
History Blame Contribute Delete
43.2 kB
{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 3.0,
"eval_steps": 46,
"global_step": 231,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.012987012987012988,
"grad_norm": 1.87213933467865,
"learning_rate": 0.0,
"loss": 2.0615234375,
"step": 1
},
{
"epoch": 0.025974025974025976,
"grad_norm": 1.8280295133590698,
"learning_rate": 4.285714285714285e-05,
"loss": 2.0244140625,
"step": 2
},
{
"epoch": 0.03896103896103896,
"grad_norm": 1.7257976531982422,
"learning_rate": 8.57142857142857e-05,
"loss": 1.9833984375,
"step": 3
},
{
"epoch": 0.05194805194805195,
"grad_norm": 1.095306396484375,
"learning_rate": 0.00012857142857142855,
"loss": 1.64453125,
"step": 4
},
{
"epoch": 0.06493506493506493,
"grad_norm": 0.7179261445999146,
"learning_rate": 0.0001714285714285714,
"loss": 1.462890625,
"step": 5
},
{
"epoch": 0.07792207792207792,
"grad_norm": 0.6510278582572937,
"learning_rate": 0.00021428571428571427,
"loss": 1.3759765625,
"step": 6
},
{
"epoch": 0.09090909090909091,
"grad_norm": 0.7297303080558777,
"learning_rate": 0.0002571428571428571,
"loss": 1.2939453125,
"step": 7
},
{
"epoch": 0.1038961038961039,
"grad_norm": 1.0976759195327759,
"learning_rate": 0.0003,
"loss": 1.251953125,
"step": 8
},
{
"epoch": 0.11688311688311688,
"grad_norm": 0.784932553768158,
"learning_rate": 0.00029998672298754263,
"loss": 1.22265625,
"step": 9
},
{
"epoch": 0.12987012987012986,
"grad_norm": 0.43049532175064087,
"learning_rate": 0.00029994689456171213,
"loss": 1.1572265625,
"step": 10
},
{
"epoch": 0.14285714285714285,
"grad_norm": 0.33999693393707275,
"learning_rate": 0.0002998805225566197,
"loss": 1.130859375,
"step": 11
},
{
"epoch": 0.15584415584415584,
"grad_norm": 0.3334054946899414,
"learning_rate": 0.0002997876200274052,
"loss": 1.095703125,
"step": 12
},
{
"epoch": 0.16883116883116883,
"grad_norm": 0.2966606020927429,
"learning_rate": 0.0002996682052476692,
"loss": 1.0859375,
"step": 13
},
{
"epoch": 0.18181818181818182,
"grad_norm": 0.26707810163497925,
"learning_rate": 0.0002995223017058786,
"loss": 1.046875,
"step": 14
},
{
"epoch": 0.19480519480519481,
"grad_norm": 0.28306645154953003,
"learning_rate": 0.0002993499381007466,
"loss": 1.04541015625,
"step": 15
},
{
"epoch": 0.2077922077922078,
"grad_norm": 0.23590394854545593,
"learning_rate": 0.00029915114833558773,
"loss": 1.04052734375,
"step": 16
},
{
"epoch": 0.22077922077922077,
"grad_norm": 0.24167655408382416,
"learning_rate": 0.0002989259715116493,
"loss": 1.015625,
"step": 17
},
{
"epoch": 0.23376623376623376,
"grad_norm": 0.23228426277637482,
"learning_rate": 0.0002986744519204201,
"loss": 1.0029296875,
"step": 18
},
{
"epoch": 0.24675324675324675,
"grad_norm": 0.19363808631896973,
"learning_rate": 0.00029839663903491866,
"loss": 0.99560546875,
"step": 19
},
{
"epoch": 0.2597402597402597,
"grad_norm": 0.1860397756099701,
"learning_rate": 0.0002980925874999618,
"loss": 0.9765625,
"step": 20
},
{
"epoch": 0.2727272727272727,
"grad_norm": 0.2304859608411789,
"learning_rate": 0.0002977623571214165,
"loss": 0.9609375,
"step": 21
},
{
"epoch": 0.2857142857142857,
"grad_norm": 0.16191796958446503,
"learning_rate": 0.0002974060128544361,
"loss": 0.96435546875,
"step": 22
},
{
"epoch": 0.2987012987012987,
"grad_norm": 0.1535877287387848,
"learning_rate": 0.0002970236247906838,
"loss": 0.94482421875,
"step": 23
},
{
"epoch": 0.3116883116883117,
"grad_norm": 0.16574719548225403,
"learning_rate": 0.00029661526814454614,
"loss": 0.95751953125,
"step": 24
},
{
"epoch": 0.3246753246753247,
"grad_norm": 0.12907439470291138,
"learning_rate": 0.00029618102323833835,
"loss": 0.95703125,
"step": 25
},
{
"epoch": 0.33766233766233766,
"grad_norm": 0.17094935476779938,
"learning_rate": 0.0002957209754865053,
"loss": 0.9365234375,
"step": 26
},
{
"epoch": 0.35064935064935066,
"grad_norm": 0.13920217752456665,
"learning_rate": 0.0002952352153788207,
"loss": 0.9169921875,
"step": 27
},
{
"epoch": 0.36363636363636365,
"grad_norm": 0.1395276039838791,
"learning_rate": 0.0002947238384625884,
"loss": 0.91162109375,
"step": 28
},
{
"epoch": 0.37662337662337664,
"grad_norm": 0.13648754358291626,
"learning_rate": 0.00029418694532384816,
"loss": 0.8974609375,
"step": 29
},
{
"epoch": 0.38961038961038963,
"grad_norm": 0.14142100512981415,
"learning_rate": 0.00029362464156759097,
"loss": 0.91259765625,
"step": 30
},
{
"epoch": 0.4025974025974026,
"grad_norm": 0.16501010954380035,
"learning_rate": 0.00029303703779698685,
"loss": 0.90869140625,
"step": 31
},
{
"epoch": 0.4155844155844156,
"grad_norm": 0.13708695769309998,
"learning_rate": 0.0002924242495916296,
"loss": 0.912109375,
"step": 32
},
{
"epoch": 0.42857142857142855,
"grad_norm": 0.13800117373466492,
"learning_rate": 0.0002917863974848027,
"loss": 0.87939453125,
"step": 33
},
{
"epoch": 0.44155844155844154,
"grad_norm": 0.13274608552455902,
"learning_rate": 0.00029112360693977097,
"loss": 0.88037109375,
"step": 34
},
{
"epoch": 0.45454545454545453,
"grad_norm": 0.1371767818927765,
"learning_rate": 0.00029043600832510204,
"loss": 0.88232421875,
"step": 35
},
{
"epoch": 0.4675324675324675,
"grad_norm": 0.13572870194911957,
"learning_rate": 0.0002897237368890237,
"loss": 0.8623046875,
"step": 36
},
{
"epoch": 0.4805194805194805,
"grad_norm": 0.11858779937028885,
"learning_rate": 0.0002889869327328208,
"loss": 0.87451171875,
"step": 37
},
{
"epoch": 0.4935064935064935,
"grad_norm": 0.12619827687740326,
"learning_rate": 0.000288225740783278,
"loss": 0.86767578125,
"step": 38
},
{
"epoch": 0.5064935064935064,
"grad_norm": 0.13159024715423584,
"learning_rate": 0.00028744031076417305,
"loss": 0.86279296875,
"step": 39
},
{
"epoch": 0.5194805194805194,
"grad_norm": 0.1415332555770874,
"learning_rate": 0.00028663079716682654,
"loss": 0.8681640625,
"step": 40
},
{
"epoch": 0.5324675324675324,
"grad_norm": 0.13881753385066986,
"learning_rate": 0.0002857973592197144,
"loss": 0.861328125,
"step": 41
},
{
"epoch": 0.5454545454545454,
"grad_norm": 0.13636034727096558,
"learning_rate": 0.0002849401608571477,
"loss": 0.85107421875,
"step": 42
},
{
"epoch": 0.5584415584415584,
"grad_norm": 0.12355201691389084,
"learning_rate": 0.0002840593706870279,
"loss": 0.86865234375,
"step": 43
},
{
"epoch": 0.5714285714285714,
"grad_norm": 0.12506555020809174,
"learning_rate": 0.00028315516195768174,
"loss": 0.8505859375,
"step": 44
},
{
"epoch": 0.5844155844155844,
"grad_norm": 0.14793701469898224,
"learning_rate": 0.00028222771252378424,
"loss": 0.84716796875,
"step": 45
},
{
"epoch": 0.5974025974025974,
"grad_norm": 0.14449597895145416,
"learning_rate": 0.0002812772048113752,
"loss": 0.84130859375,
"step": 46
},
{
"epoch": 0.6103896103896104,
"grad_norm": 0.12865683436393738,
"learning_rate": 0.0002803038257819767,
"loss": 0.828125,
"step": 47
},
{
"epoch": 0.6103896103896104,
"eval_loss": 0.82568359375,
"eval_runtime": 5.2278,
"eval_samples_per_second": 0.574,
"eval_steps_per_second": 0.191,
"step": 47
},
{
"epoch": 0.6233766233766234,
"grad_norm": 0.13512910902500153,
"learning_rate": 0.0002793077668958183,
"loss": 0.833984375,
"step": 48
},
{
"epoch": 0.6363636363636364,
"grad_norm": 0.13676807284355164,
"learning_rate": 0.00027828922407417776,
"loss": 0.81689453125,
"step": 49
},
{
"epoch": 0.6493506493506493,
"grad_norm": 0.16256316006183624,
"learning_rate": 0.0002772483976608436,
"loss": 0.85791015625,
"step": 50
},
{
"epoch": 0.6623376623376623,
"grad_norm": 0.12291904538869858,
"learning_rate": 0.00027618549238270847,
"loss": 0.82373046875,
"step": 51
},
{
"epoch": 0.6753246753246753,
"grad_norm": 0.13355045020580292,
"learning_rate": 0.00027510071730950007,
"loss": 0.83056640625,
"step": 52
},
{
"epoch": 0.6883116883116883,
"grad_norm": 0.11801909655332565,
"learning_rate": 0.0002739942858126579,
"loss": 0.84033203125,
"step": 53
},
{
"epoch": 0.7012987012987013,
"grad_norm": 0.13418525457382202,
"learning_rate": 0.00027286641552336363,
"loss": 0.80224609375,
"step": 54
},
{
"epoch": 0.7142857142857143,
"grad_norm": 0.197087362408638,
"learning_rate": 0.0002717173282897339,
"loss": 0.82275390625,
"step": 55
},
{
"epoch": 0.7272727272727273,
"grad_norm": 0.13710831105709076,
"learning_rate": 0.000270547250133184,
"loss": 0.814453125,
"step": 56
},
{
"epoch": 0.7402597402597403,
"grad_norm": 0.12212483584880829,
"learning_rate": 0.0002693564112039695,
"loss": 0.83740234375,
"step": 57
},
{
"epoch": 0.7532467532467533,
"grad_norm": 0.1577882468700409,
"learning_rate": 0.00026814504573591697,
"loss": 0.8076171875,
"step": 58
},
{
"epoch": 0.7662337662337663,
"grad_norm": 0.13262887299060822,
"learning_rate": 0.00026691339200035115,
"loss": 0.80712890625,
"step": 59
},
{
"epoch": 0.7792207792207793,
"grad_norm": 0.15435634553432465,
"learning_rate": 0.0002656616922592273,
"loss": 0.8154296875,
"step": 60
},
{
"epoch": 0.7922077922077922,
"grad_norm": 0.15156027674674988,
"learning_rate": 0.00026439019271747976,
"loss": 0.822265625,
"step": 61
},
{
"epoch": 0.8051948051948052,
"grad_norm": 0.16566747426986694,
"learning_rate": 0.0002630991434745936,
"loss": 0.8134765625,
"step": 62
},
{
"epoch": 0.8181818181818182,
"grad_norm": 1.7740538120269775,
"learning_rate": 0.00026178879847541165,
"loss": 0.7353515625,
"step": 63
},
{
"epoch": 0.8311688311688312,
"grad_norm": 0.22738465666770935,
"learning_rate": 0.0002604594154601839,
"loss": 0.81103515625,
"step": 64
},
{
"epoch": 0.8441558441558441,
"grad_norm": 0.1551813930273056,
"learning_rate": 0.0002591112559138711,
"loss": 0.7880859375,
"step": 65
},
{
"epoch": 0.8571428571428571,
"grad_norm": 0.16187018156051636,
"learning_rate": 0.0002577445850147117,
"loss": 0.814453125,
"step": 66
},
{
"epoch": 0.8701298701298701,
"grad_norm": 0.17352460324764252,
"learning_rate": 0.000256359671582062,
"loss": 0.810546875,
"step": 67
},
{
"epoch": 0.8831168831168831,
"grad_norm": 0.135048046708107,
"learning_rate": 0.00025495678802352055,
"loss": 0.78759765625,
"step": 68
},
{
"epoch": 0.8961038961038961,
"grad_norm": 0.14645102620124817,
"learning_rate": 0.0002535362102813462,
"loss": 0.79345703125,
"step": 69
},
{
"epoch": 0.9090909090909091,
"grad_norm": 0.1465066522359848,
"learning_rate": 0.00025209821777818185,
"loss": 0.7919921875,
"step": 70
},
{
"epoch": 0.922077922077922,
"grad_norm": 0.1380114108324051,
"learning_rate": 0.00025064309336209214,
"loss": 0.80712890625,
"step": 71
},
{
"epoch": 0.935064935064935,
"grad_norm": 0.12721604108810425,
"learning_rate": 0.000249171123250929,
"loss": 0.802734375,
"step": 72
},
{
"epoch": 0.948051948051948,
"grad_norm": 0.1371970921754837,
"learning_rate": 0.0002476825969760332,
"loss": 0.7880859375,
"step": 73
},
{
"epoch": 0.961038961038961,
"grad_norm": 0.1347561925649643,
"learning_rate": 0.00024617780732528473,
"loss": 0.7841796875,
"step": 74
},
{
"epoch": 0.974025974025974,
"grad_norm": 0.13435688614845276,
"learning_rate": 0.00024465705028551226,
"loss": 0.79150390625,
"step": 75
},
{
"epoch": 0.987012987012987,
"grad_norm": 0.14081783592700958,
"learning_rate": 0.00024312062498427377,
"loss": 0.7978515625,
"step": 76
},
{
"epoch": 1.0,
"grad_norm": 0.15651436150074005,
"learning_rate": 0.000241568833631019,
"loss": 0.7998046875,
"step": 77
},
{
"epoch": 1.0129870129870129,
"grad_norm": 0.15834945440292358,
"learning_rate": 0.0002400019814576463,
"loss": 0.79931640625,
"step": 78
},
{
"epoch": 1.025974025974026,
"grad_norm": 0.1488344669342041,
"learning_rate": 0.00023842037665846406,
"loss": 0.78759765625,
"step": 79
},
{
"epoch": 1.0389610389610389,
"grad_norm": 0.16658146679401398,
"learning_rate": 0.0002368243303295704,
"loss": 0.80029296875,
"step": 80
},
{
"epoch": 1.051948051948052,
"grad_norm": 0.15831144154071808,
"learning_rate": 0.00023521415640766154,
"loss": 0.78857421875,
"step": 81
},
{
"epoch": 1.0649350649350648,
"grad_norm": 0.16039662063121796,
"learning_rate": 0.00023359017160828145,
"loss": 0.814453125,
"step": 82
},
{
"epoch": 1.077922077922078,
"grad_norm": 0.1471472680568695,
"learning_rate": 0.00023195269536352515,
"loss": 0.8017578125,
"step": 83
},
{
"epoch": 1.0909090909090908,
"grad_norm": 0.14966650307178497,
"learning_rate": 0.00023030204975920735,
"loss": 0.7705078125,
"step": 84
},
{
"epoch": 1.103896103896104,
"grad_norm": 0.15895777940750122,
"learning_rate": 0.00022863855947150968,
"loss": 0.77587890625,
"step": 85
},
{
"epoch": 1.1168831168831168,
"grad_norm": 0.12899424135684967,
"learning_rate": 0.00022696255170311756,
"loss": 0.78173828125,
"step": 86
},
{
"epoch": 1.12987012987013,
"grad_norm": 0.15755796432495117,
"learning_rate": 0.000225274356118861,
"loss": 0.76953125,
"step": 87
},
{
"epoch": 1.1428571428571428,
"grad_norm": 0.1485254317522049,
"learning_rate": 0.0002235743047808703,
"loss": 0.7734375,
"step": 88
},
{
"epoch": 1.155844155844156,
"grad_norm": 0.13911904394626617,
"learning_rate": 0.00022186273208326106,
"loss": 0.771484375,
"step": 89
},
{
"epoch": 1.1688311688311688,
"grad_norm": 0.1418519765138626,
"learning_rate": 0.00022013997468635946,
"loss": 0.7783203125,
"step": 90
},
{
"epoch": 1.1818181818181819,
"grad_norm": 0.13031873106956482,
"learning_rate": 0.00021840637145048293,
"loss": 0.755859375,
"step": 91
},
{
"epoch": 1.1948051948051948,
"grad_norm": 0.13562628626823425,
"learning_rate": 0.00021666226336928708,
"loss": 0.76806640625,
"step": 92
},
{
"epoch": 1.2077922077922079,
"grad_norm": 0.12203909456729889,
"learning_rate": 0.00021490799350269382,
"loss": 0.7802734375,
"step": 93
},
{
"epoch": 1.2077922077922079,
"eval_loss": 0.763671875,
"eval_runtime": 5.239,
"eval_samples_per_second": 0.573,
"eval_steps_per_second": 0.191,
"step": 93
},
{
"epoch": 1.2207792207792207,
"grad_norm": 0.21283617615699768,
"learning_rate": 0.00021314390690941224,
"loss": 0.77001953125,
"step": 94
},
{
"epoch": 1.2337662337662338,
"grad_norm": 0.15730828046798706,
"learning_rate": 0.0002113703505790672,
"loss": 0.75830078125,
"step": 95
},
{
"epoch": 1.2467532467532467,
"grad_norm": 0.1455293744802475,
"learning_rate": 0.00020958767336394757,
"loss": 0.771484375,
"step": 96
},
{
"epoch": 1.2597402597402598,
"grad_norm": 0.16305232048034668,
"learning_rate": 0.0002077962259103879,
"loss": 0.76123046875,
"step": 97
},
{
"epoch": 1.2727272727272727,
"grad_norm": 0.1328314244747162,
"learning_rate": 0.00020599636058979797,
"loss": 0.755859375,
"step": 98
},
{
"epoch": 1.2857142857142856,
"grad_norm": 0.17356440424919128,
"learning_rate": 0.00020418843142935237,
"loss": 0.771484375,
"step": 99
},
{
"epoch": 1.2987012987012987,
"grad_norm": 0.1250755339860916,
"learning_rate": 0.00020237279404235463,
"loss": 0.75146484375,
"step": 100
},
{
"epoch": 1.3116883116883118,
"grad_norm": 0.16211764514446259,
"learning_rate": 0.00020054980555828922,
"loss": 0.7841796875,
"step": 101
},
{
"epoch": 1.3246753246753247,
"grad_norm": 0.12787924706935883,
"learning_rate": 0.0001987198245525756,
"loss": 0.7783203125,
"step": 102
},
{
"epoch": 1.3376623376623376,
"grad_norm": 0.1527280956506729,
"learning_rate": 0.00019688321097603763,
"loss": 0.76318359375,
"step": 103
},
{
"epoch": 1.3506493506493507,
"grad_norm": 0.15530425310134888,
"learning_rate": 0.0001950403260841024,
"loss": 0.75537109375,
"step": 104
},
{
"epoch": 1.3636363636363638,
"grad_norm": 0.13351191580295563,
"learning_rate": 0.0001931915323657429,
"loss": 0.75048828125,
"step": 105
},
{
"epoch": 1.3766233766233766,
"grad_norm": 0.15366774797439575,
"learning_rate": 0.00019133719347217733,
"loss": 0.7451171875,
"step": 106
},
{
"epoch": 1.3896103896103895,
"grad_norm": 0.1421225517988205,
"learning_rate": 0.00018947767414534026,
"loss": 0.76513671875,
"step": 107
},
{
"epoch": 1.4025974025974026,
"grad_norm": 0.16189341247081757,
"learning_rate": 0.0001876133401461394,
"loss": 0.76318359375,
"step": 108
},
{
"epoch": 1.4155844155844157,
"grad_norm": 0.1491364985704422,
"learning_rate": 0.00018574455818251153,
"loss": 0.76708984375,
"step": 109
},
{
"epoch": 1.4285714285714286,
"grad_norm": 0.15627354383468628,
"learning_rate": 0.0001838716958372924,
"loss": 0.74365234375,
"step": 110
},
{
"epoch": 1.4415584415584415,
"grad_norm": 0.15001991391181946,
"learning_rate": 0.0001819951214959144,
"loss": 0.74658203125,
"step": 111
},
{
"epoch": 1.4545454545454546,
"grad_norm": 0.16454966366291046,
"learning_rate": 0.00018011520427394656,
"loss": 0.751953125,
"step": 112
},
{
"epoch": 1.4675324675324675,
"grad_norm": 0.15415698289871216,
"learning_rate": 0.00017823231394449072,
"loss": 0.732421875,
"step": 113
},
{
"epoch": 1.4805194805194806,
"grad_norm": 0.1775464415550232,
"learning_rate": 0.0001763468208654484,
"loss": 0.7490234375,
"step": 114
},
{
"epoch": 1.4935064935064934,
"grad_norm": 0.15247026085853577,
"learning_rate": 0.00017445909590667308,
"loss": 0.74658203125,
"step": 115
},
{
"epoch": 1.5064935064935066,
"grad_norm": 0.1464771032333374,
"learning_rate": 0.00017256951037702086,
"loss": 0.7421875,
"step": 116
},
{
"epoch": 1.5194805194805194,
"grad_norm": 0.1753479391336441,
"learning_rate": 0.0001706784359513158,
"loss": 0.75,
"step": 117
},
{
"epoch": 1.5324675324675323,
"grad_norm": 0.14175550639629364,
"learning_rate": 0.00016878624459724232,
"loss": 0.74560546875,
"step": 118
},
{
"epoch": 1.5454545454545454,
"grad_norm": 0.17048415541648865,
"learning_rate": 0.0001668933085021809,
"loss": 0.74169921875,
"step": 119
},
{
"epoch": 1.5584415584415585,
"grad_norm": 0.12695848941802979,
"learning_rate": 0.000165,
"loss": 0.75537109375,
"step": 120
},
{
"epoch": 1.5714285714285714,
"grad_norm": 0.17318251729011536,
"learning_rate": 0.0001631066914978191,
"loss": 0.74560546875,
"step": 121
},
{
"epoch": 1.5844155844155843,
"grad_norm": 0.1290905475616455,
"learning_rate": 0.00016121375540275768,
"loss": 0.73583984375,
"step": 122
},
{
"epoch": 1.5974025974025974,
"grad_norm": 0.15674766898155212,
"learning_rate": 0.00015932156404868423,
"loss": 0.7373046875,
"step": 123
},
{
"epoch": 1.6103896103896105,
"grad_norm": 0.12684033811092377,
"learning_rate": 0.00015743048962297909,
"loss": 0.724609375,
"step": 124
},
{
"epoch": 1.6233766233766234,
"grad_norm": 0.13366860151290894,
"learning_rate": 0.0001555409040933269,
"loss": 0.73876953125,
"step": 125
},
{
"epoch": 1.6363636363636362,
"grad_norm": 0.13589990139007568,
"learning_rate": 0.0001536531791345516,
"loss": 0.71875,
"step": 126
},
{
"epoch": 1.6493506493506493,
"grad_norm": 0.16754822432994843,
"learning_rate": 0.0001517676860555093,
"loss": 0.76123046875,
"step": 127
},
{
"epoch": 1.6623376623376624,
"grad_norm": 0.1312442421913147,
"learning_rate": 0.00014988479572605344,
"loss": 0.72802734375,
"step": 128
},
{
"epoch": 1.6753246753246753,
"grad_norm": 0.139266237616539,
"learning_rate": 0.0001480048785040856,
"loss": 0.73779296875,
"step": 129
},
{
"epoch": 1.6883116883116882,
"grad_norm": 0.15041179955005646,
"learning_rate": 0.00014612830416270762,
"loss": 0.75048828125,
"step": 130
},
{
"epoch": 1.7012987012987013,
"grad_norm": 0.1343003362417221,
"learning_rate": 0.00014425544181748842,
"loss": 0.71142578125,
"step": 131
},
{
"epoch": 1.7142857142857144,
"grad_norm": 0.14581982791423798,
"learning_rate": 0.00014238665985386059,
"loss": 0.73583984375,
"step": 132
},
{
"epoch": 1.7272727272727273,
"grad_norm": 0.1320425122976303,
"learning_rate": 0.00014052232585465974,
"loss": 0.72509765625,
"step": 133
},
{
"epoch": 1.7402597402597402,
"grad_norm": 0.1291089653968811,
"learning_rate": 0.00013866280652782267,
"loss": 0.7529296875,
"step": 134
},
{
"epoch": 1.7532467532467533,
"grad_norm": 0.14452627301216125,
"learning_rate": 0.0001368084676342571,
"loss": 0.72216796875,
"step": 135
},
{
"epoch": 1.7662337662337664,
"grad_norm": 0.1396491974592209,
"learning_rate": 0.00013495967391589757,
"loss": 0.72314453125,
"step": 136
},
{
"epoch": 1.7792207792207793,
"grad_norm": 0.13734738528728485,
"learning_rate": 0.0001331167890239624,
"loss": 0.73291015625,
"step": 137
},
{
"epoch": 1.7922077922077921,
"grad_norm": 0.14117233455181122,
"learning_rate": 0.00013128017544742433,
"loss": 0.740234375,
"step": 138
},
{
"epoch": 1.8051948051948052,
"grad_norm": 0.15530674159526825,
"learning_rate": 0.00012945019444171073,
"loss": 0.73193359375,
"step": 139
},
{
"epoch": 1.8051948051948052,
"eval_loss": 0.7353515625,
"eval_runtime": 5.2158,
"eval_samples_per_second": 0.575,
"eval_steps_per_second": 0.192,
"step": 139
},
{
"epoch": 1.8181818181818183,
"grad_norm": 0.11231274902820587,
"learning_rate": 0.00012762720595764534,
"loss": 0.569091796875,
"step": 140
},
{
"epoch": 1.8311688311688312,
"grad_norm": 0.16321395337581635,
"learning_rate": 0.0001258115685706476,
"loss": 0.7314453125,
"step": 141
},
{
"epoch": 1.844155844155844,
"grad_norm": 0.12513551115989685,
"learning_rate": 0.000124003639410202,
"loss": 0.70849609375,
"step": 142
},
{
"epoch": 1.8571428571428572,
"grad_norm": 0.13610848784446716,
"learning_rate": 0.0001222037740896121,
"loss": 0.73779296875,
"step": 143
},
{
"epoch": 1.87012987012987,
"grad_norm": 0.13166917860507965,
"learning_rate": 0.00012041232663605247,
"loss": 0.73388671875,
"step": 144
},
{
"epoch": 1.883116883116883,
"grad_norm": 0.13057149946689606,
"learning_rate": 0.00011862964942093274,
"loss": 0.712890625,
"step": 145
},
{
"epoch": 1.896103896103896,
"grad_norm": 0.12715107202529907,
"learning_rate": 0.00011685609309058775,
"loss": 0.71875,
"step": 146
},
{
"epoch": 1.9090909090909092,
"grad_norm": 0.12808527052402496,
"learning_rate": 0.00011509200649730618,
"loss": 0.72021484375,
"step": 147
},
{
"epoch": 1.922077922077922,
"grad_norm": 0.1350717395544052,
"learning_rate": 0.00011333773663071288,
"loss": 0.73095703125,
"step": 148
},
{
"epoch": 1.935064935064935,
"grad_norm": 0.13831068575382233,
"learning_rate": 0.00011159362854951708,
"loss": 0.73193359375,
"step": 149
},
{
"epoch": 1.948051948051948,
"grad_norm": 0.12841732800006866,
"learning_rate": 0.00010986002531364053,
"loss": 0.71630859375,
"step": 150
},
{
"epoch": 1.9610389610389611,
"grad_norm": 0.13850335776805878,
"learning_rate": 0.00010813726791673898,
"loss": 0.71240234375,
"step": 151
},
{
"epoch": 1.974025974025974,
"grad_norm": 0.13993798196315765,
"learning_rate": 0.00010642569521912966,
"loss": 0.72314453125,
"step": 152
},
{
"epoch": 1.987012987012987,
"grad_norm": 0.18451233208179474,
"learning_rate": 0.00010472564388113902,
"loss": 0.72705078125,
"step": 153
},
{
"epoch": 2.0,
"grad_norm": 0.13638709485530853,
"learning_rate": 0.00010303744829688239,
"loss": 0.73291015625,
"step": 154
},
{
"epoch": 2.012987012987013,
"grad_norm": 0.1541544646024704,
"learning_rate": 0.00010136144052849031,
"loss": 0.73193359375,
"step": 155
},
{
"epoch": 2.0259740259740258,
"grad_norm": 0.15249796211719513,
"learning_rate": 9.969795024079262e-05,
"loss": 0.7216796875,
"step": 156
},
{
"epoch": 2.038961038961039,
"grad_norm": 0.14103059470653534,
"learning_rate": 9.804730463647488e-05,
"loss": 0.73193359375,
"step": 157
},
{
"epoch": 2.051948051948052,
"grad_norm": 0.15410536527633667,
"learning_rate": 9.640982839171855e-05,
"loss": 0.72509765625,
"step": 158
},
{
"epoch": 2.064935064935065,
"grad_norm": 0.1409735381603241,
"learning_rate": 9.478584359233841e-05,
"loss": 0.75341796875,
"step": 159
},
{
"epoch": 2.0779220779220777,
"grad_norm": 0.15072405338287354,
"learning_rate": 9.317566967042957e-05,
"loss": 0.7412109375,
"step": 160
},
{
"epoch": 2.090909090909091,
"grad_norm": 0.14849328994750977,
"learning_rate": 9.157962334153595e-05,
"loss": 0.7080078125,
"step": 161
},
{
"epoch": 2.103896103896104,
"grad_norm": 0.13942044973373413,
"learning_rate": 8.999801854235373e-05,
"loss": 0.71337890625,
"step": 162
},
{
"epoch": 2.116883116883117,
"grad_norm": 0.145473450422287,
"learning_rate": 8.843116636898095e-05,
"loss": 0.7216796875,
"step": 163
},
{
"epoch": 2.1298701298701297,
"grad_norm": 0.1532512605190277,
"learning_rate": 8.687937501572622e-05,
"loss": 0.70849609375,
"step": 164
},
{
"epoch": 2.142857142857143,
"grad_norm": 0.13344669342041016,
"learning_rate": 8.534294971448771e-05,
"loss": 0.7138671875,
"step": 165
},
{
"epoch": 2.155844155844156,
"grad_norm": 0.13642649352550507,
"learning_rate": 8.382219267471518e-05,
"loss": 0.7119140625,
"step": 166
},
{
"epoch": 2.168831168831169,
"grad_norm": 0.1385343223810196,
"learning_rate": 8.231740302396673e-05,
"loss": 0.720703125,
"step": 167
},
{
"epoch": 2.1818181818181817,
"grad_norm": 0.1423710137605667,
"learning_rate": 8.082887674907099e-05,
"loss": 0.6982421875,
"step": 168
},
{
"epoch": 2.1948051948051948,
"grad_norm": 0.13223981857299805,
"learning_rate": 7.935690663790787e-05,
"loss": 0.70947265625,
"step": 169
},
{
"epoch": 2.207792207792208,
"grad_norm": 0.13550648093223572,
"learning_rate": 7.79017822218182e-05,
"loss": 0.7236328125,
"step": 170
},
{
"epoch": 2.220779220779221,
"grad_norm": 0.13676981627941132,
"learning_rate": 7.646378971865376e-05,
"loss": 0.7119140625,
"step": 171
},
{
"epoch": 2.2337662337662336,
"grad_norm": 0.13250000774860382,
"learning_rate": 7.504321197647948e-05,
"loss": 0.70263671875,
"step": 172
},
{
"epoch": 2.2467532467532467,
"grad_norm": 0.13027453422546387,
"learning_rate": 7.364032841793795e-05,
"loss": 0.71728515625,
"step": 173
},
{
"epoch": 2.25974025974026,
"grad_norm": 0.13419416546821594,
"learning_rate": 7.225541498528827e-05,
"loss": 0.70849609375,
"step": 174
},
{
"epoch": 2.2727272727272725,
"grad_norm": 0.12558883428573608,
"learning_rate": 7.088874408612886e-05,
"loss": 0.7021484375,
"step": 175
},
{
"epoch": 2.2857142857142856,
"grad_norm": 0.12302929908037186,
"learning_rate": 6.954058453981609e-05,
"loss": 0.71923828125,
"step": 176
},
{
"epoch": 2.2987012987012987,
"grad_norm": 0.12381301075220108,
"learning_rate": 6.821120152458832e-05,
"loss": 0.69921875,
"step": 177
},
{
"epoch": 2.311688311688312,
"grad_norm": 0.12083020806312561,
"learning_rate": 6.690085652540637e-05,
"loss": 0.7333984375,
"step": 178
},
{
"epoch": 2.324675324675325,
"grad_norm": 0.1192907765507698,
"learning_rate": 6.560980728252027e-05,
"loss": 0.72705078125,
"step": 179
},
{
"epoch": 2.3376623376623376,
"grad_norm": 0.12227894365787506,
"learning_rate": 6.433830774077264e-05,
"loss": 0.71142578125,
"step": 180
},
{
"epoch": 2.3506493506493507,
"grad_norm": 0.131501704454422,
"learning_rate": 6.308660799964886e-05,
"loss": 0.705078125,
"step": 181
},
{
"epoch": 2.3636363636363638,
"grad_norm": 0.13152176141738892,
"learning_rate": 6.185495426408299e-05,
"loss": 0.701171875,
"step": 182
},
{
"epoch": 2.3766233766233764,
"grad_norm": 0.13369899988174438,
"learning_rate": 6.06435887960305e-05,
"loss": 0.69482421875,
"step": 183
},
{
"epoch": 2.3896103896103895,
"grad_norm": 0.1293274462223053,
"learning_rate": 5.945274986681598e-05,
"loss": 0.71630859375,
"step": 184
},
{
"epoch": 2.4025974025974026,
"grad_norm": 0.13225723803043365,
"learning_rate": 5.828267171026604e-05,
"loss": 0.712890625,
"step": 185
},
{
"epoch": 2.4025974025974026,
"eval_loss": 0.72265625,
"eval_runtime": 5.2195,
"eval_samples_per_second": 0.575,
"eval_steps_per_second": 0.192,
"step": 185
},
{
"epoch": 2.4155844155844157,
"grad_norm": 0.12458571791648865,
"learning_rate": 5.7133584476636404e-05,
"loss": 0.7197265625,
"step": 186
},
{
"epoch": 2.4285714285714284,
"grad_norm": 0.12707853317260742,
"learning_rate": 5.600571418734207e-05,
"loss": 0.6982421875,
"step": 187
},
{
"epoch": 2.4415584415584415,
"grad_norm": 0.12470997869968414,
"learning_rate": 5.489928269049988e-05,
"loss": 0.7001953125,
"step": 188
},
{
"epoch": 2.4545454545454546,
"grad_norm": 0.12834584712982178,
"learning_rate": 5.381450761729153e-05,
"loss": 0.70654296875,
"step": 189
},
{
"epoch": 2.4675324675324677,
"grad_norm": 0.12546005845069885,
"learning_rate": 5.275160233915637e-05,
"loss": 0.6875,
"step": 190
},
{
"epoch": 2.4805194805194803,
"grad_norm": 0.12444262951612473,
"learning_rate": 5.171077592582221e-05,
"loss": 0.7060546875,
"step": 191
},
{
"epoch": 2.4935064935064934,
"grad_norm": 0.12773482501506805,
"learning_rate": 5.069223310418164e-05,
"loss": 0.703125,
"step": 192
},
{
"epoch": 2.5064935064935066,
"grad_norm": 0.12552465498447418,
"learning_rate": 4.96961742180233e-05,
"loss": 0.69677734375,
"step": 193
},
{
"epoch": 2.5194805194805197,
"grad_norm": 0.12379507720470428,
"learning_rate": 4.8722795188624785e-05,
"loss": 0.70556640625,
"step": 194
},
{
"epoch": 2.5324675324675323,
"grad_norm": 0.1199096292257309,
"learning_rate": 4.777228747621577e-05,
"loss": 0.70166015625,
"step": 195
},
{
"epoch": 2.5454545454545454,
"grad_norm": 0.1276472806930542,
"learning_rate": 4.684483804231825e-05,
"loss": 0.697265625,
"step": 196
},
{
"epoch": 2.5584415584415585,
"grad_norm": 0.12995445728302002,
"learning_rate": 4.5940629312972085e-05,
"loss": 0.712890625,
"step": 197
},
{
"epoch": 2.571428571428571,
"grad_norm": 0.12648777663707733,
"learning_rate": 4.505983914285226e-05,
"loss": 0.7041015625,
"step": 198
},
{
"epoch": 2.5844155844155843,
"grad_norm": 0.11970824003219604,
"learning_rate": 4.420264078028558e-05,
"loss": 0.69091796875,
"step": 199
},
{
"epoch": 2.5974025974025974,
"grad_norm": 0.13187578320503235,
"learning_rate": 4.336920283317343e-05,
"loss": 0.69580078125,
"step": 200
},
{
"epoch": 2.6103896103896105,
"grad_norm": 0.13241389393806458,
"learning_rate": 4.2559689235826924e-05,
"loss": 0.6826171875,
"step": 201
},
{
"epoch": 2.6233766233766236,
"grad_norm": 0.11591418087482452,
"learning_rate": 4.177425921672195e-05,
"loss": 0.69970703125,
"step": 202
},
{
"epoch": 2.6363636363636362,
"grad_norm": 0.12381508201360703,
"learning_rate": 4.1013067267179154e-05,
"loss": 0.67724609375,
"step": 203
},
{
"epoch": 2.6493506493506493,
"grad_norm": 0.13161423802375793,
"learning_rate": 4.027626311097629e-05,
"loss": 0.72216796875,
"step": 204
},
{
"epoch": 2.6623376623376624,
"grad_norm": 0.1228082925081253,
"learning_rate": 3.9563991674897954e-05,
"loss": 0.68896484375,
"step": 205
},
{
"epoch": 2.675324675324675,
"grad_norm": 0.1269020289182663,
"learning_rate": 3.8876393060229044e-05,
"loss": 0.69970703125,
"step": 206
},
{
"epoch": 2.688311688311688,
"grad_norm": 0.11776472628116608,
"learning_rate": 3.8213602515197275e-05,
"loss": 0.7138671875,
"step": 207
},
{
"epoch": 2.7012987012987013,
"grad_norm": 0.12243116647005081,
"learning_rate": 3.757575040837037e-05,
"loss": 0.673828125,
"step": 208
},
{
"epoch": 2.7142857142857144,
"grad_norm": 0.11943550407886505,
"learning_rate": 3.696296220301314e-05,
"loss": 0.69677734375,
"step": 209
},
{
"epoch": 2.7272727272727275,
"grad_norm": 0.12474703043699265,
"learning_rate": 3.6375358432408994e-05,
"loss": 0.68896484375,
"step": 210
},
{
"epoch": 2.74025974025974,
"grad_norm": 0.12555579841136932,
"learning_rate": 3.581305467615181e-05,
"loss": 0.71826171875,
"step": 211
},
{
"epoch": 2.7532467532467533,
"grad_norm": 0.11739861965179443,
"learning_rate": 3.5276161537411566e-05,
"loss": 0.68701171875,
"step": 212
},
{
"epoch": 2.7662337662337664,
"grad_norm": 0.12477493286132812,
"learning_rate": 3.476478462117927e-05,
"loss": 0.6875,
"step": 213
},
{
"epoch": 2.779220779220779,
"grad_norm": 0.12658150494098663,
"learning_rate": 3.427902451349472e-05,
"loss": 0.69775390625,
"step": 214
},
{
"epoch": 2.792207792207792,
"grad_norm": 0.12858550250530243,
"learning_rate": 3.381897676166161e-05,
"loss": 0.70458984375,
"step": 215
},
{
"epoch": 2.8051948051948052,
"grad_norm": 0.12537240982055664,
"learning_rate": 3.338473185545381e-05,
"loss": 0.69921875,
"step": 216
},
{
"epoch": 2.8181818181818183,
"grad_norm": 0.10256601870059967,
"learning_rate": 3.2976375209316176e-05,
"loss": 0.5439453125,
"step": 217
},
{
"epoch": 2.8311688311688314,
"grad_norm": 0.12630337476730347,
"learning_rate": 3.259398714556389e-05,
"loss": 0.69580078125,
"step": 218
},
{
"epoch": 2.844155844155844,
"grad_norm": 0.13245722651481628,
"learning_rate": 3.223764287858346e-05,
"loss": 0.6748046875,
"step": 219
},
{
"epoch": 2.857142857142857,
"grad_norm": 0.12287378311157227,
"learning_rate": 3.1907412500038153e-05,
"loss": 0.70556640625,
"step": 220
},
{
"epoch": 2.87012987012987,
"grad_norm": 0.1266852766275406,
"learning_rate": 3.1603360965081314e-05,
"loss": 0.701171875,
"step": 221
},
{
"epoch": 2.883116883116883,
"grad_norm": 0.11965059489011765,
"learning_rate": 3.132554807957984e-05,
"loss": 0.68212890625,
"step": 222
},
{
"epoch": 2.896103896103896,
"grad_norm": 0.1284727156162262,
"learning_rate": 3.107402848835067e-05,
"loss": 0.68798828125,
"step": 223
},
{
"epoch": 2.909090909090909,
"grad_norm": 0.12175902724266052,
"learning_rate": 3.0848851664412245e-05,
"loss": 0.69189453125,
"step": 224
},
{
"epoch": 2.9220779220779223,
"grad_norm": 0.12249225378036499,
"learning_rate": 3.065006189925343e-05,
"loss": 0.7001953125,
"step": 225
},
{
"epoch": 2.935064935064935,
"grad_norm": 0.1305171102285385,
"learning_rate": 3.0477698294121423e-05,
"loss": 0.70361328125,
"step": 226
},
{
"epoch": 2.948051948051948,
"grad_norm": 0.12238122522830963,
"learning_rate": 3.0331794752330784e-05,
"loss": 0.6875,
"step": 227
},
{
"epoch": 2.961038961038961,
"grad_norm": 0.13102811574935913,
"learning_rate": 3.0212379972594758e-05,
"loss": 0.6826171875,
"step": 228
},
{
"epoch": 2.974025974025974,
"grad_norm": 0.12523294985294342,
"learning_rate": 3.011947744338027e-05,
"loss": 0.69287109375,
"step": 229
},
{
"epoch": 2.987012987012987,
"grad_norm": 0.13497743010520935,
"learning_rate": 3.0053105438287863e-05,
"loss": 0.69775390625,
"step": 230
},
{
"epoch": 3.0,
"grad_norm": 0.13393673300743103,
"learning_rate": 3.0013277012457374e-05,
"loss": 0.70654296875,
"step": 231
},
{
"epoch": 3.0,
"eval_loss": 0.71484375,
"eval_runtime": 5.2419,
"eval_samples_per_second": 0.572,
"eval_steps_per_second": 0.191,
"step": 231
}
],
"logging_steps": 1.0,
"max_steps": 231,
"num_input_tokens_seen": 0,
"num_train_epochs": 3,
"save_steps": 0,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": true
},
"attributes": {}
}
},
"total_flos": 2.0012235103068488e+19,
"train_batch_size": 1,
"trial_name": null,
"trial_params": null
}