B2plus_v4_qwen72_e2 / trainer_state.json
Taywon's picture
Upload folder using huggingface_hub
e59f8c7 verified
Raw
History Blame Contribute Delete
62.9 kB
{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 2.0,
"eval_steps": 500,
"global_step": 206,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"entropy": 1.4083243012428284,
"epoch": 0.009708737864077669,
"grad_norm": 0.94761723279953,
"learning_rate": 0.0,
"loss": 1.9706486463546753,
"mean_token_accuracy": 0.5420544818043709,
"num_tokens": 97105.0,
"step": 1
},
{
"entropy": 1.421248883008957,
"epoch": 0.019417475728155338,
"grad_norm": 1.021393060684204,
"learning_rate": 3.125e-06,
"loss": 2.03873872756958,
"mean_token_accuracy": 0.5355476140975952,
"num_tokens": 192679.0,
"step": 2
},
{
"entropy": 1.4670909941196442,
"epoch": 0.02912621359223301,
"grad_norm": 0.8904154896736145,
"learning_rate": 6.25e-06,
"loss": 1.994919776916504,
"mean_token_accuracy": 0.5325814262032509,
"num_tokens": 290599.0,
"step": 3
},
{
"entropy": 1.5951472371816635,
"epoch": 0.038834951456310676,
"grad_norm": 0.6973261833190918,
"learning_rate": 9.375000000000001e-06,
"loss": 1.9966566562652588,
"mean_token_accuracy": 0.5266260281205177,
"num_tokens": 388130.0,
"step": 4
},
{
"entropy": 1.6103769689798355,
"epoch": 0.04854368932038835,
"grad_norm": 0.5392856597900391,
"learning_rate": 1.25e-05,
"loss": 1.8900949954986572,
"mean_token_accuracy": 0.5452185645699501,
"num_tokens": 485983.0,
"step": 5
},
{
"entropy": 1.7284279018640518,
"epoch": 0.05825242718446602,
"grad_norm": 0.4281271696090698,
"learning_rate": 1.5625e-05,
"loss": 1.8690071105957031,
"mean_token_accuracy": 0.5448430627584457,
"num_tokens": 583257.0,
"step": 6
},
{
"entropy": 1.79091015458107,
"epoch": 0.06796116504854369,
"grad_norm": 0.4108770191669464,
"learning_rate": 1.8750000000000002e-05,
"loss": 1.8907827138900757,
"mean_token_accuracy": 0.5405718386173248,
"num_tokens": 678553.0,
"step": 7
},
{
"entropy": 1.8500836789608002,
"epoch": 0.07766990291262135,
"grad_norm": 0.35201919078826904,
"learning_rate": 2.1875e-05,
"loss": 1.8045190572738647,
"mean_token_accuracy": 0.5530312657356262,
"num_tokens": 774991.0,
"step": 8
},
{
"entropy": 1.9261595904827118,
"epoch": 0.08737864077669903,
"grad_norm": 0.36849886178970337,
"learning_rate": 2.5e-05,
"loss": 1.7962449789047241,
"mean_token_accuracy": 0.5506185740232468,
"num_tokens": 871685.0,
"step": 9
},
{
"entropy": 1.875639259815216,
"epoch": 0.0970873786407767,
"grad_norm": 0.36218366026878357,
"learning_rate": 2.8125000000000003e-05,
"loss": 1.703657627105713,
"mean_token_accuracy": 0.5688499510288239,
"num_tokens": 968934.0,
"step": 10
},
{
"entropy": 1.8956582099199295,
"epoch": 0.10679611650485436,
"grad_norm": 0.38436606526374817,
"learning_rate": 3.125e-05,
"loss": 1.6929868459701538,
"mean_token_accuracy": 0.5671246349811554,
"num_tokens": 1066190.0,
"step": 11
},
{
"entropy": 1.9003087729215622,
"epoch": 0.11650485436893204,
"grad_norm": 0.38454198837280273,
"learning_rate": 3.4375e-05,
"loss": 1.6784961223602295,
"mean_token_accuracy": 0.5702497884631157,
"num_tokens": 1163717.0,
"step": 12
},
{
"entropy": 1.7804109752178192,
"epoch": 0.1262135922330097,
"grad_norm": 0.34963515400886536,
"learning_rate": 3.7500000000000003e-05,
"loss": 1.609951376914978,
"mean_token_accuracy": 0.5796908214688301,
"num_tokens": 1261260.0,
"step": 13
},
{
"entropy": 1.6776917278766632,
"epoch": 0.13592233009708737,
"grad_norm": 0.2801634669303894,
"learning_rate": 4.0625000000000005e-05,
"loss": 1.5957839488983154,
"mean_token_accuracy": 0.5835207626223564,
"num_tokens": 1358315.0,
"step": 14
},
{
"entropy": 1.5199688822031021,
"epoch": 0.14563106796116504,
"grad_norm": 0.27892422676086426,
"learning_rate": 4.375e-05,
"loss": 1.5371708869934082,
"mean_token_accuracy": 0.5937215387821198,
"num_tokens": 1455424.0,
"step": 15
},
{
"entropy": 1.42391437292099,
"epoch": 0.1553398058252427,
"grad_norm": 0.36465972661972046,
"learning_rate": 4.6875e-05,
"loss": 1.5261038541793823,
"mean_token_accuracy": 0.5960521325469017,
"num_tokens": 1552741.0,
"step": 16
},
{
"entropy": 1.4002629518508911,
"epoch": 0.1650485436893204,
"grad_norm": 0.33470022678375244,
"learning_rate": 5e-05,
"loss": 1.506011962890625,
"mean_token_accuracy": 0.5978913903236389,
"num_tokens": 1650044.0,
"step": 17
},
{
"entropy": 1.4228239804506302,
"epoch": 0.17475728155339806,
"grad_norm": 0.24347813427448273,
"learning_rate": 4.999856295503635e-05,
"loss": 1.4823517799377441,
"mean_token_accuracy": 0.599531851708889,
"num_tokens": 1747782.0,
"step": 18
},
{
"entropy": 1.448434516787529,
"epoch": 0.18446601941747573,
"grad_norm": 0.20727963745594025,
"learning_rate": 4.999425198535325e-05,
"loss": 1.463187575340271,
"mean_token_accuracy": 0.6064818128943443,
"num_tokens": 1845724.0,
"step": 19
},
{
"entropy": 1.4923068583011627,
"epoch": 0.1941747572815534,
"grad_norm": 0.2315221130847931,
"learning_rate": 4.998706758655528e-05,
"loss": 1.4465688467025757,
"mean_token_accuracy": 0.6043036803603172,
"num_tokens": 1943411.0,
"step": 20
},
{
"entropy": 1.472718134522438,
"epoch": 0.20388349514563106,
"grad_norm": 0.24738778173923492,
"learning_rate": 4.997701058458676e-05,
"loss": 1.4063471555709839,
"mean_token_accuracy": 0.6147852465510368,
"num_tokens": 2041045.0,
"step": 21
},
{
"entropy": 1.4919932037591934,
"epoch": 0.21359223300970873,
"grad_norm": 0.21912068128585815,
"learning_rate": 4.996408213563684e-05,
"loss": 1.4053853750228882,
"mean_token_accuracy": 0.6167104989290237,
"num_tokens": 2138535.0,
"step": 22
},
{
"entropy": 1.4844385087490082,
"epoch": 0.22330097087378642,
"grad_norm": 0.22786955535411835,
"learning_rate": 4.994828372600649e-05,
"loss": 1.3828628063201904,
"mean_token_accuracy": 0.6216765120625496,
"num_tokens": 2235538.0,
"step": 23
},
{
"entropy": 1.4436479061841965,
"epoch": 0.23300970873786409,
"grad_norm": 0.19272480905056,
"learning_rate": 4.9929617171937724e-05,
"loss": 1.3706296682357788,
"mean_token_accuracy": 0.6209864541888237,
"num_tokens": 2332954.0,
"step": 24
},
{
"entropy": 1.4084927588701248,
"epoch": 0.24271844660194175,
"grad_norm": 0.17803719639778137,
"learning_rate": 4.9908084619404735e-05,
"loss": 1.3561553955078125,
"mean_token_accuracy": 0.6240377500653267,
"num_tokens": 2431031.0,
"step": 25
},
{
"entropy": 1.3695293813943863,
"epoch": 0.2524271844660194,
"grad_norm": 0.1710546761751175,
"learning_rate": 4.988368854386722e-05,
"loss": 1.3544114828109741,
"mean_token_accuracy": 0.6251663640141487,
"num_tokens": 2527933.0,
"step": 26
},
{
"entropy": 1.2857100814580917,
"epoch": 0.2621359223300971,
"grad_norm": 0.18847821652889252,
"learning_rate": 4.985643174998578e-05,
"loss": 1.3139867782592773,
"mean_token_accuracy": 0.6356627941131592,
"num_tokens": 2625130.0,
"step": 27
},
{
"entropy": 1.280667930841446,
"epoch": 0.27184466019417475,
"grad_norm": 0.19685013592243195,
"learning_rate": 4.982631737129948e-05,
"loss": 1.3132545948028564,
"mean_token_accuracy": 0.6352921947836876,
"num_tokens": 2722735.0,
"step": 28
},
{
"entropy": 1.3028772920370102,
"epoch": 0.2815533980582524,
"grad_norm": 0.19354666769504547,
"learning_rate": 4.9793348869865616e-05,
"loss": 1.3400448560714722,
"mean_token_accuracy": 0.6271930709481239,
"num_tokens": 2820721.0,
"step": 29
},
{
"entropy": 1.3173751831054688,
"epoch": 0.2912621359223301,
"grad_norm": 0.16872914135456085,
"learning_rate": 4.9757530035861716e-05,
"loss": 1.3304100036621094,
"mean_token_accuracy": 0.6323504224419594,
"num_tokens": 2918531.0,
"step": 30
},
{
"entropy": 1.284382238984108,
"epoch": 0.30097087378640774,
"grad_norm": 0.17004726827144623,
"learning_rate": 4.971886498714977e-05,
"loss": 1.2796059846878052,
"mean_token_accuracy": 0.6409082934260368,
"num_tokens": 3014027.0,
"step": 31
},
{
"entropy": 1.3059177845716476,
"epoch": 0.3106796116504854,
"grad_norm": 0.17118602991104126,
"learning_rate": 4.967735816880286e-05,
"loss": 1.2877871990203857,
"mean_token_accuracy": 0.6396790593862534,
"num_tokens": 3111172.0,
"step": 32
},
{
"entropy": 1.3147014528512955,
"epoch": 0.32038834951456313,
"grad_norm": 0.16340142488479614,
"learning_rate": 4.963301435259413e-05,
"loss": 1.2802796363830566,
"mean_token_accuracy": 0.6386668905615807,
"num_tokens": 3208860.0,
"step": 33
},
{
"entropy": 1.3065699636936188,
"epoch": 0.3300970873786408,
"grad_norm": 0.1647864431142807,
"learning_rate": 4.95858386364482e-05,
"loss": 1.2798354625701904,
"mean_token_accuracy": 0.6393692642450333,
"num_tokens": 3305964.0,
"step": 34
},
{
"entropy": 1.2940323948860168,
"epoch": 0.33980582524271846,
"grad_norm": 0.15510039031505585,
"learning_rate": 4.9535836443855096e-05,
"loss": 1.2712514400482178,
"mean_token_accuracy": 0.6405108198523521,
"num_tokens": 3403337.0,
"step": 35
},
{
"entropy": 1.2636306136846542,
"epoch": 0.34951456310679613,
"grad_norm": 0.16528593003749847,
"learning_rate": 4.948301352324673e-05,
"loss": 1.2383002042770386,
"mean_token_accuracy": 0.6498897895216942,
"num_tokens": 3500500.0,
"step": 36
},
{
"entropy": 1.2304436564445496,
"epoch": 0.3592233009708738,
"grad_norm": 0.15354204177856445,
"learning_rate": 4.942737594733609e-05,
"loss": 1.2233033180236816,
"mean_token_accuracy": 0.6514501944184303,
"num_tokens": 3597306.0,
"step": 37
},
{
"entropy": 1.2565466612577438,
"epoch": 0.36893203883495146,
"grad_norm": 0.15500810742378235,
"learning_rate": 4.9368930112419e-05,
"loss": 1.2482693195343018,
"mean_token_accuracy": 0.645413227379322,
"num_tokens": 3694352.0,
"step": 38
},
{
"entropy": 1.2443159818649292,
"epoch": 0.3786407766990291,
"grad_norm": 0.15541698038578033,
"learning_rate": 4.930768273763889e-05,
"loss": 1.2520265579223633,
"mean_token_accuracy": 0.6438535004854202,
"num_tokens": 3792464.0,
"step": 39
},
{
"entropy": 1.2296875715255737,
"epoch": 0.3883495145631068,
"grad_norm": 0.15958574414253235,
"learning_rate": 4.92436408642143e-05,
"loss": 1.2351443767547607,
"mean_token_accuracy": 0.6492253467440605,
"num_tokens": 3889619.0,
"step": 40
},
{
"entropy": 1.2195448875427246,
"epoch": 0.39805825242718446,
"grad_norm": 0.1615312397480011,
"learning_rate": 4.917681185462934e-05,
"loss": 1.2214652299880981,
"mean_token_accuracy": 0.6524631232023239,
"num_tokens": 3986630.0,
"step": 41
},
{
"entropy": 1.2140728384256363,
"epoch": 0.4077669902912621,
"grad_norm": 0.15110917389392853,
"learning_rate": 4.910720339178735e-05,
"loss": 1.2222949266433716,
"mean_token_accuracy": 0.6521077156066895,
"num_tokens": 4083691.0,
"step": 42
},
{
"entropy": 1.2051743566989899,
"epoch": 0.4174757281553398,
"grad_norm": 0.1491296887397766,
"learning_rate": 4.90348234781276e-05,
"loss": 1.2039450407028198,
"mean_token_accuracy": 0.654543362557888,
"num_tokens": 4181870.0,
"step": 43
},
{
"entropy": 1.2167726755142212,
"epoch": 0.42718446601941745,
"grad_norm": 0.1601928472518921,
"learning_rate": 4.895968043470532e-05,
"loss": 1.2167367935180664,
"mean_token_accuracy": 0.65306556224823,
"num_tokens": 4277672.0,
"step": 44
},
{
"entropy": 1.1795921474695206,
"epoch": 0.4368932038834951,
"grad_norm": 0.14628776907920837,
"learning_rate": 4.8881782900235094e-05,
"loss": 1.1818878650665283,
"mean_token_accuracy": 0.6603984162211418,
"num_tokens": 4375365.0,
"step": 45
},
{
"entropy": 1.2080871313810349,
"epoch": 0.44660194174757284,
"grad_norm": 0.15034087002277374,
"learning_rate": 4.880113983009768e-05,
"loss": 1.2044813632965088,
"mean_token_accuracy": 0.6534772142767906,
"num_tokens": 4472689.0,
"step": 46
},
{
"entropy": 1.2424661964178085,
"epoch": 0.4563106796116505,
"grad_norm": 0.14910851418972015,
"learning_rate": 4.87177604953105e-05,
"loss": 1.2322750091552734,
"mean_token_accuracy": 0.6469002515077591,
"num_tokens": 4569961.0,
"step": 47
},
{
"entropy": 1.209616169333458,
"epoch": 0.46601941747572817,
"grad_norm": 0.14911304414272308,
"learning_rate": 4.86316544814618e-05,
"loss": 1.2000218629837036,
"mean_token_accuracy": 0.6570775136351585,
"num_tokens": 4667359.0,
"step": 48
},
{
"entropy": 1.201382964849472,
"epoch": 0.47572815533980584,
"grad_norm": 0.17708911001682281,
"learning_rate": 4.854283168760868e-05,
"loss": 1.1916768550872803,
"mean_token_accuracy": 0.6561535075306892,
"num_tokens": 4765400.0,
"step": 49
},
{
"entropy": 1.1911841928958893,
"epoch": 0.4854368932038835,
"grad_norm": 0.1523158699274063,
"learning_rate": 4.8451302325139004e-05,
"loss": 1.1832383871078491,
"mean_token_accuracy": 0.6573370844125748,
"num_tokens": 4863204.0,
"step": 50
},
{
"entropy": 1.1881461590528488,
"epoch": 0.49514563106796117,
"grad_norm": 0.15072602033615112,
"learning_rate": 4.835707691659753e-05,
"loss": 1.1761033535003662,
"mean_token_accuracy": 0.6590301543474197,
"num_tokens": 4960926.0,
"step": 51
},
{
"entropy": 1.1763849258422852,
"epoch": 0.5048543689320388,
"grad_norm": 0.15600641071796417,
"learning_rate": 4.8260166294476164e-05,
"loss": 1.1728320121765137,
"mean_token_accuracy": 0.6621676161885262,
"num_tokens": 5058013.0,
"step": 52
},
{
"entropy": 1.1916624307632446,
"epoch": 0.5145631067961165,
"grad_norm": 0.15378843247890472,
"learning_rate": 4.8160581599968625e-05,
"loss": 1.184821367263794,
"mean_token_accuracy": 0.6572789996862411,
"num_tokens": 5153970.0,
"step": 53
},
{
"entropy": 1.1805166453123093,
"epoch": 0.5242718446601942,
"grad_norm": 0.15211763978004456,
"learning_rate": 4.8058334281689595e-05,
"loss": 1.1789004802703857,
"mean_token_accuracy": 0.658557578921318,
"num_tokens": 5251276.0,
"step": 54
},
{
"entropy": 1.1733617633581161,
"epoch": 0.5339805825242718,
"grad_norm": 0.15024270117282867,
"learning_rate": 4.7953436094358595e-05,
"loss": 1.1704764366149902,
"mean_token_accuracy": 0.6585692763328552,
"num_tokens": 5348605.0,
"step": 55
},
{
"entropy": 1.1367567777633667,
"epoch": 0.5436893203883495,
"grad_norm": 0.14717121422290802,
"learning_rate": 4.784589909744855e-05,
"loss": 1.1350934505462646,
"mean_token_accuracy": 0.6707980632781982,
"num_tokens": 5446513.0,
"step": 56
},
{
"entropy": 1.1633624881505966,
"epoch": 0.5533980582524272,
"grad_norm": 0.15170669555664062,
"learning_rate": 4.7735735653799463e-05,
"loss": 1.1654052734375,
"mean_token_accuracy": 0.6653316840529442,
"num_tokens": 5543963.0,
"step": 57
},
{
"entropy": 1.1694072782993317,
"epoch": 0.5631067961165048,
"grad_norm": 0.14897707104682922,
"learning_rate": 4.762295842819707e-05,
"loss": 1.1644500494003296,
"mean_token_accuracy": 0.6641355082392693,
"num_tokens": 5641181.0,
"step": 58
},
{
"entropy": 1.1587684005498886,
"epoch": 0.5728155339805825,
"grad_norm": 0.14866051077842712,
"learning_rate": 4.75075803859169e-05,
"loss": 1.1571202278137207,
"mean_token_accuracy": 0.6645473390817642,
"num_tokens": 5738020.0,
"step": 59
},
{
"entropy": 1.1717360317707062,
"epoch": 0.5825242718446602,
"grad_norm": 0.15497078001499176,
"learning_rate": 4.7389614791233726e-05,
"loss": 1.1673715114593506,
"mean_token_accuracy": 0.662636861205101,
"num_tokens": 5835528.0,
"step": 60
},
{
"entropy": 1.1693744212388992,
"epoch": 0.5922330097087378,
"grad_norm": 0.15867234766483307,
"learning_rate": 4.726907520589664e-05,
"loss": 1.1548094749450684,
"mean_token_accuracy": 0.6624177768826485,
"num_tokens": 5933622.0,
"step": 61
},
{
"entropy": 1.1339199990034103,
"epoch": 0.6019417475728155,
"grad_norm": 0.15212447941303253,
"learning_rate": 4.714597548756996e-05,
"loss": 1.1325181722640991,
"mean_token_accuracy": 0.6707736179232597,
"num_tokens": 6030609.0,
"step": 62
},
{
"entropy": 1.1296663135290146,
"epoch": 0.6116504854368932,
"grad_norm": 0.15575166046619415,
"learning_rate": 4.702032978824011e-05,
"loss": 1.1267575025558472,
"mean_token_accuracy": 0.6701638028025627,
"num_tokens": 6127908.0,
"step": 63
},
{
"entropy": 1.1318050771951675,
"epoch": 0.6213592233009708,
"grad_norm": 0.15813998878002167,
"learning_rate": 4.6892152552588655e-05,
"loss": 1.1390020847320557,
"mean_token_accuracy": 0.6672858372330666,
"num_tokens": 6225260.0,
"step": 64
},
{
"entropy": 1.1477476954460144,
"epoch": 0.6310679611650486,
"grad_norm": 0.15706756711006165,
"learning_rate": 4.6761458516331655e-05,
"loss": 1.153120994567871,
"mean_token_accuracy": 0.663187600672245,
"num_tokens": 6322811.0,
"step": 65
},
{
"entropy": 1.133908674120903,
"epoch": 0.6407766990291263,
"grad_norm": 0.1579563319683075,
"learning_rate": 4.662826270452565e-05,
"loss": 1.1408581733703613,
"mean_token_accuracy": 0.6672231107950211,
"num_tokens": 6419134.0,
"step": 66
},
{
"entropy": 1.150125876069069,
"epoch": 0.6504854368932039,
"grad_norm": 0.15973767638206482,
"learning_rate": 4.649258042984026e-05,
"loss": 1.1557530164718628,
"mean_token_accuracy": 0.6634695678949356,
"num_tokens": 6516137.0,
"step": 67
},
{
"entropy": 1.124921292066574,
"epoch": 0.6601941747572816,
"grad_norm": 0.15293626487255096,
"learning_rate": 4.6354427290797875e-05,
"loss": 1.1272459030151367,
"mean_token_accuracy": 0.6693216189742088,
"num_tokens": 6613796.0,
"step": 68
},
{
"entropy": 1.1551329046487808,
"epoch": 0.6699029126213593,
"grad_norm": 0.15234892070293427,
"learning_rate": 4.621381916998029e-05,
"loss": 1.1462955474853516,
"mean_token_accuracy": 0.6653169468045235,
"num_tokens": 6711660.0,
"step": 69
},
{
"entropy": 1.1397110670804977,
"epoch": 0.6796116504854369,
"grad_norm": 0.15561261773109436,
"learning_rate": 4.607077223220285e-05,
"loss": 1.1248576641082764,
"mean_token_accuracy": 0.6719892099499702,
"num_tokens": 6808587.0,
"step": 70
},
{
"entropy": 1.1522215157747269,
"epoch": 0.6893203883495146,
"grad_norm": 0.1659662127494812,
"learning_rate": 4.592530292265609e-05,
"loss": 1.1409823894500732,
"mean_token_accuracy": 0.6674581989645958,
"num_tokens": 6906120.0,
"step": 71
},
{
"entropy": 1.1350633352994919,
"epoch": 0.6990291262135923,
"grad_norm": 0.15686708688735962,
"learning_rate": 4.5777427965015096e-05,
"loss": 1.128638744354248,
"mean_token_accuracy": 0.6704377010464668,
"num_tokens": 7004058.0,
"step": 72
},
{
"entropy": 1.1182153522968292,
"epoch": 0.7087378640776699,
"grad_norm": 0.15111538767814636,
"learning_rate": 4.562716435951692e-05,
"loss": 1.1166245937347412,
"mean_token_accuracy": 0.6737237125635147,
"num_tokens": 7101920.0,
"step": 73
},
{
"entropy": 1.1188742965459824,
"epoch": 0.7184466019417476,
"grad_norm": 0.15409265458583832,
"learning_rate": 4.5474529381006146e-05,
"loss": 1.118614673614502,
"mean_token_accuracy": 0.6710415109992027,
"num_tokens": 7198756.0,
"step": 74
},
{
"entropy": 1.1149023473262787,
"epoch": 0.7281553398058253,
"grad_norm": 0.16151487827301025,
"learning_rate": 4.531954057694897e-05,
"loss": 1.1311017274856567,
"mean_token_accuracy": 0.6720475554466248,
"num_tokens": 7296339.0,
"step": 75
},
{
"entropy": 1.1312980204820633,
"epoch": 0.7378640776699029,
"grad_norm": 0.1549658626317978,
"learning_rate": 4.516221576541581e-05,
"loss": 1.1340723037719727,
"mean_token_accuracy": 0.6688062027096748,
"num_tokens": 7393950.0,
"step": 76
},
{
"entropy": 1.1147898435592651,
"epoch": 0.7475728155339806,
"grad_norm": 0.15624849498271942,
"learning_rate": 4.5002573033032904e-05,
"loss": 1.1091203689575195,
"mean_token_accuracy": 0.674225278198719,
"num_tokens": 7489205.0,
"step": 77
},
{
"entropy": 1.137469932436943,
"epoch": 0.7572815533980582,
"grad_norm": 0.16516146063804626,
"learning_rate": 4.484063073290301e-05,
"loss": 1.1193323135375977,
"mean_token_accuracy": 0.6739235296845436,
"num_tokens": 7584161.0,
"step": 78
},
{
"entropy": 1.1054588705301285,
"epoch": 0.7669902912621359,
"grad_norm": 0.15215378999710083,
"learning_rate": 4.467640748249548e-05,
"loss": 1.1007866859436035,
"mean_token_accuracy": 0.6783005967736244,
"num_tokens": 7681353.0,
"step": 79
},
{
"entropy": 1.0961224287748337,
"epoch": 0.7766990291262136,
"grad_norm": 0.15287643671035767,
"learning_rate": 4.4509922161505926e-05,
"loss": 1.0958147048950195,
"mean_token_accuracy": 0.676163524389267,
"num_tokens": 7778582.0,
"step": 80
},
{
"entropy": 1.1254196166992188,
"epoch": 0.7864077669902912,
"grad_norm": 0.16113276779651642,
"learning_rate": 4.4341193909685686e-05,
"loss": 1.130951166152954,
"mean_token_accuracy": 0.6697586253285408,
"num_tokens": 7874950.0,
"step": 81
},
{
"entropy": 1.0993820428848267,
"epoch": 0.7961165048543689,
"grad_norm": 0.1620422899723053,
"learning_rate": 4.417024212464152e-05,
"loss": 1.1005873680114746,
"mean_token_accuracy": 0.6766335293650627,
"num_tokens": 7971956.0,
"step": 82
},
{
"entropy": 1.1041197627782822,
"epoch": 0.8058252427184466,
"grad_norm": 0.15546955168247223,
"learning_rate": 4.399708645960559e-05,
"loss": 1.10465407371521,
"mean_token_accuracy": 0.674575038254261,
"num_tokens": 8068461.0,
"step": 83
},
{
"entropy": 1.0924506783485413,
"epoch": 0.8155339805825242,
"grad_norm": 0.16429384052753448,
"learning_rate": 4.382174682117598e-05,
"loss": 1.093902587890625,
"mean_token_accuracy": 0.6806196495890617,
"num_tokens": 8166250.0,
"step": 84
},
{
"entropy": 1.1175890564918518,
"epoch": 0.8252427184466019,
"grad_norm": 0.1590225100517273,
"learning_rate": 4.364424336702825e-05,
"loss": 1.1183996200561523,
"mean_token_accuracy": 0.6712751016020775,
"num_tokens": 8263412.0,
"step": 85
},
{
"entropy": 1.091995120048523,
"epoch": 0.8349514563106796,
"grad_norm": 0.16027086973190308,
"learning_rate": 4.346459650359798e-05,
"loss": 1.089324951171875,
"mean_token_accuracy": 0.6779745444655418,
"num_tokens": 8361054.0,
"step": 86
},
{
"entropy": 1.1091380715370178,
"epoch": 0.8446601941747572,
"grad_norm": 0.16367396712303162,
"learning_rate": 4.328282688373479e-05,
"loss": 1.1101912260055542,
"mean_token_accuracy": 0.6726596802473068,
"num_tokens": 8458058.0,
"step": 87
},
{
"entropy": 1.1332892328500748,
"epoch": 0.8543689320388349,
"grad_norm": 0.16062098741531372,
"learning_rate": 4.3098955404328045e-05,
"loss": 1.1345933675765991,
"mean_token_accuracy": 0.669020764529705,
"num_tokens": 8552707.0,
"step": 88
},
{
"entropy": 1.124135971069336,
"epoch": 0.8640776699029126,
"grad_norm": 0.15737071633338928,
"learning_rate": 4.29130032039044e-05,
"loss": 1.1120331287384033,
"mean_token_accuracy": 0.6742131784558296,
"num_tokens": 8648715.0,
"step": 89
},
{
"entropy": 1.11882945895195,
"epoch": 0.8737864077669902,
"grad_norm": 0.15959268808364868,
"learning_rate": 4.272499166019771e-05,
"loss": 1.117668628692627,
"mean_token_accuracy": 0.6719657182693481,
"num_tokens": 8744790.0,
"step": 90
},
{
"entropy": 1.1137337386608124,
"epoch": 0.883495145631068,
"grad_norm": 0.1567354053258896,
"learning_rate": 4.253494238769134e-05,
"loss": 1.10910165309906,
"mean_token_accuracy": 0.6751311644911766,
"num_tokens": 8841963.0,
"step": 91
},
{
"entropy": 1.0963155031204224,
"epoch": 0.8932038834951457,
"grad_norm": 0.16550451517105103,
"learning_rate": 4.234287723513326e-05,
"loss": 1.0936603546142578,
"mean_token_accuracy": 0.6774952635169029,
"num_tokens": 8938823.0,
"step": 92
},
{
"entropy": 1.1137651056051254,
"epoch": 0.9029126213592233,
"grad_norm": 0.15746837854385376,
"learning_rate": 4.2148818283024304e-05,
"loss": 1.11457097530365,
"mean_token_accuracy": 0.6719932034611702,
"num_tokens": 9036976.0,
"step": 93
},
{
"entropy": 1.085622027516365,
"epoch": 0.912621359223301,
"grad_norm": 0.16476289927959442,
"learning_rate": 4.195278784107964e-05,
"loss": 1.086329460144043,
"mean_token_accuracy": 0.677251435816288,
"num_tokens": 9134903.0,
"step": 94
},
{
"entropy": 1.1134615540504456,
"epoch": 0.9223300970873787,
"grad_norm": 0.16442131996154785,
"learning_rate": 4.175480844566404e-05,
"loss": 1.1127569675445557,
"mean_token_accuracy": 0.6718188151717186,
"num_tokens": 9231494.0,
"step": 95
},
{
"entropy": 1.1019631028175354,
"epoch": 0.9320388349514563,
"grad_norm": 0.15546253323554993,
"learning_rate": 4.1554902857200924e-05,
"loss": 1.0951738357543945,
"mean_token_accuracy": 0.6784623265266418,
"num_tokens": 9328418.0,
"step": 96
},
{
"entropy": 1.0921340584754944,
"epoch": 0.941747572815534,
"grad_norm": 0.16863901913166046,
"learning_rate": 4.135309405755583e-05,
"loss": 1.0979890823364258,
"mean_token_accuracy": 0.6765805631875992,
"num_tokens": 9426256.0,
"step": 97
},
{
"entropy": 1.104684755206108,
"epoch": 0.9514563106796117,
"grad_norm": 0.16420894861221313,
"learning_rate": 4.11494052473943e-05,
"loss": 1.106919765472412,
"mean_token_accuracy": 0.6736476495862007,
"num_tokens": 9523841.0,
"step": 98
},
{
"entropy": 1.0703193694353104,
"epoch": 0.9611650485436893,
"grad_norm": 0.1605386883020401,
"learning_rate": 4.094385984351462e-05,
"loss": 1.0785481929779053,
"mean_token_accuracy": 0.6812796592712402,
"num_tokens": 9621225.0,
"step": 99
},
{
"entropy": 1.090438723564148,
"epoch": 0.970873786407767,
"grad_norm": 0.15666428208351135,
"learning_rate": 4.073648147615579e-05,
"loss": 1.0910429954528809,
"mean_token_accuracy": 0.6792959794402122,
"num_tokens": 9718805.0,
"step": 100
},
{
"entropy": 1.1004114151000977,
"epoch": 0.9805825242718447,
"grad_norm": 0.16704976558685303,
"learning_rate": 4.052729398628089e-05,
"loss": 1.0998764038085938,
"mean_token_accuracy": 0.6745198145508766,
"num_tokens": 9816814.0,
"step": 101
},
{
"entropy": 1.0953031778335571,
"epoch": 0.9902912621359223,
"grad_norm": 0.16081705689430237,
"learning_rate": 4.031632142283622e-05,
"loss": 1.0844577550888062,
"mean_token_accuracy": 0.6796873956918716,
"num_tokens": 9914411.0,
"step": 102
},
{
"entropy": 1.0845869928598404,
"epoch": 1.0,
"grad_norm": 0.16136308014392853,
"learning_rate": 4.0103588039986556e-05,
"loss": 1.0797569751739502,
"mean_token_accuracy": 0.6803081929683685,
"num_tokens": 10010251.0,
"step": 103
},
{
"entropy": 1.068443089723587,
"epoch": 1.0097087378640777,
"grad_norm": 0.1638786494731903,
"learning_rate": 3.988911829432682e-05,
"loss": 1.0353350639343262,
"mean_token_accuracy": 0.6882663518190384,
"num_tokens": 10106628.0,
"step": 104
},
{
"entropy": 1.0666862949728966,
"epoch": 1.0194174757281553,
"grad_norm": 0.16060160100460052,
"learning_rate": 3.967293684207042e-05,
"loss": 1.04751718044281,
"mean_token_accuracy": 0.6869001239538193,
"num_tokens": 10203919.0,
"step": 105
},
{
"entropy": 1.029679775238037,
"epoch": 1.029126213592233,
"grad_norm": 0.16603456437587738,
"learning_rate": 3.945506853621476e-05,
"loss": 1.0321340560913086,
"mean_token_accuracy": 0.6923350319266319,
"num_tokens": 10301090.0,
"step": 106
},
{
"entropy": 1.0381744876503944,
"epoch": 1.0388349514563107,
"grad_norm": 0.1720408946275711,
"learning_rate": 3.923553842368396e-05,
"loss": 1.0508530139923096,
"mean_token_accuracy": 0.6882685720920563,
"num_tokens": 10398407.0,
"step": 107
},
{
"entropy": 1.0274595245718956,
"epoch": 1.0485436893203883,
"grad_norm": 0.1640644371509552,
"learning_rate": 3.901437174244943e-05,
"loss": 1.0384334325790405,
"mean_token_accuracy": 0.6870113834738731,
"num_tokens": 10496286.0,
"step": 108
},
{
"entropy": 1.051487922668457,
"epoch": 1.058252427184466,
"grad_norm": 0.17232562601566315,
"learning_rate": 3.879159391862839e-05,
"loss": 1.0552724599838257,
"mean_token_accuracy": 0.6844486594200134,
"num_tokens": 10593041.0,
"step": 109
},
{
"entropy": 1.0558612048625946,
"epoch": 1.0679611650485437,
"grad_norm": 0.16551247239112854,
"learning_rate": 3.856723056356084e-05,
"loss": 1.0514483451843262,
"mean_token_accuracy": 0.6873890236020088,
"num_tokens": 10690608.0,
"step": 110
},
{
"entropy": 1.0500814393162727,
"epoch": 1.0776699029126213,
"grad_norm": 0.16079694032669067,
"learning_rate": 3.834130747086512e-05,
"loss": 1.0406620502471924,
"mean_token_accuracy": 0.6894150301814079,
"num_tokens": 10788441.0,
"step": 111
},
{
"entropy": 1.0713951885700226,
"epoch": 1.087378640776699,
"grad_norm": 0.16561074554920197,
"learning_rate": 3.811385061347263e-05,
"loss": 1.047391414642334,
"mean_token_accuracy": 0.6867462620139122,
"num_tokens": 10886095.0,
"step": 112
},
{
"entropy": 1.0726030766963959,
"epoch": 1.0970873786407767,
"grad_norm": 0.1706630438566208,
"learning_rate": 3.788488614064188e-05,
"loss": 1.0566606521606445,
"mean_token_accuracy": 0.6830915883183479,
"num_tokens": 10983700.0,
"step": 113
},
{
"entropy": 1.0523803383111954,
"epoch": 1.1067961165048543,
"grad_norm": 0.17153160274028778,
"learning_rate": 3.7654440374952286e-05,
"loss": 1.0483253002166748,
"mean_token_accuracy": 0.6866283416748047,
"num_tokens": 11081141.0,
"step": 114
},
{
"entropy": 1.0569421201944351,
"epoch": 1.116504854368932,
"grad_norm": 0.17598958313465118,
"learning_rate": 3.742253980927799e-05,
"loss": 1.050697684288025,
"mean_token_accuracy": 0.6876719892024994,
"num_tokens": 11178553.0,
"step": 115
},
{
"entropy": 1.025670774281025,
"epoch": 1.1262135922330097,
"grad_norm": 0.1734474152326584,
"learning_rate": 3.7189211103742206e-05,
"loss": 1.0291353464126587,
"mean_token_accuracy": 0.6928240656852722,
"num_tokens": 11275288.0,
"step": 116
},
{
"entropy": 1.003603272140026,
"epoch": 1.1359223300970873,
"grad_norm": 0.16272073984146118,
"learning_rate": 3.695448108265221e-05,
"loss": 1.0103802680969238,
"mean_token_accuracy": 0.6972288712859154,
"num_tokens": 11372523.0,
"step": 117
},
{
"entropy": 1.02402725815773,
"epoch": 1.145631067961165,
"grad_norm": 0.16548147797584534,
"learning_rate": 3.671837673141559e-05,
"loss": 1.030734896659851,
"mean_token_accuracy": 0.692120373249054,
"num_tokens": 11470482.0,
"step": 118
},
{
"entropy": 1.0215473622083664,
"epoch": 1.1553398058252426,
"grad_norm": 0.16721011698246002,
"learning_rate": 3.648092519343783e-05,
"loss": 1.0301539897918701,
"mean_token_accuracy": 0.6894958764314651,
"num_tokens": 11568438.0,
"step": 119
},
{
"entropy": 1.056374877691269,
"epoch": 1.1650485436893203,
"grad_norm": 0.17408575117588043,
"learning_rate": 3.6242153767001895e-05,
"loss": 1.0481269359588623,
"mean_token_accuracy": 0.6849339008331299,
"num_tokens": 11665644.0,
"step": 120
},
{
"entropy": 1.0519457012414932,
"epoch": 1.174757281553398,
"grad_norm": 0.1641719490289688,
"learning_rate": 3.600208990212984e-05,
"loss": 1.0483492612838745,
"mean_token_accuracy": 0.6879769489169121,
"num_tokens": 11762261.0,
"step": 121
},
{
"entropy": 1.049955114722252,
"epoch": 1.1844660194174756,
"grad_norm": 0.17227791249752045,
"learning_rate": 3.5760761197427095e-05,
"loss": 1.0500767230987549,
"mean_token_accuracy": 0.6855774074792862,
"num_tokens": 11860108.0,
"step": 122
},
{
"entropy": 1.0267768576741219,
"epoch": 1.1941747572815533,
"grad_norm": 0.16169141232967377,
"learning_rate": 3.551819539690965e-05,
"loss": 1.0238873958587646,
"mean_token_accuracy": 0.6936259567737579,
"num_tokens": 11957749.0,
"step": 123
},
{
"entropy": 1.0247065424919128,
"epoch": 1.203883495145631,
"grad_norm": 0.17105494439601898,
"learning_rate": 3.527442038681446e-05,
"loss": 1.0272483825683594,
"mean_token_accuracy": 0.6926182508468628,
"num_tokens": 12055121.0,
"step": 124
},
{
"entropy": 1.0369553938508034,
"epoch": 1.2135922330097086,
"grad_norm": 0.1695042997598648,
"learning_rate": 3.5029464192393555e-05,
"loss": 1.038701057434082,
"mean_token_accuracy": 0.68787931650877,
"num_tokens": 12151377.0,
"step": 125
},
{
"entropy": 1.0596141815185547,
"epoch": 1.2233009708737863,
"grad_norm": 0.17646324634552002,
"learning_rate": 3.478335497469219e-05,
"loss": 1.0595526695251465,
"mean_token_accuracy": 0.6831439137458801,
"num_tokens": 12248560.0,
"step": 126
},
{
"entropy": 1.0373520329594612,
"epoch": 1.233009708737864,
"grad_norm": 0.19195199012756348,
"learning_rate": 3.45361210273113e-05,
"loss": 1.0353025197982788,
"mean_token_accuracy": 0.6883834302425385,
"num_tokens": 12345865.0,
"step": 127
},
{
"entropy": 1.066431000828743,
"epoch": 1.2427184466019416,
"grad_norm": 0.17165441811084747,
"learning_rate": 3.42877907731548e-05,
"loss": 1.0560047626495361,
"mean_token_accuracy": 0.6849204152822495,
"num_tokens": 12443200.0,
"step": 128
},
{
"entropy": 1.0401945114135742,
"epoch": 1.2524271844660193,
"grad_norm": 0.1729133278131485,
"learning_rate": 3.403839276116199e-05,
"loss": 1.0313591957092285,
"mean_token_accuracy": 0.6888679265975952,
"num_tokens": 12540890.0,
"step": 129
},
{
"entropy": 1.018211580812931,
"epoch": 1.262135922330097,
"grad_norm": 0.1711256206035614,
"learning_rate": 3.378795566302541e-05,
"loss": 1.0243428945541382,
"mean_token_accuracy": 0.6950447037816048,
"num_tokens": 12637489.0,
"step": 130
},
{
"entropy": 1.0643156915903091,
"epoch": 1.2718446601941746,
"grad_norm": 0.2479192018508911,
"learning_rate": 3.3536508269894724e-05,
"loss": 1.0673259496688843,
"mean_token_accuracy": 0.6813078597187996,
"num_tokens": 12735387.0,
"step": 131
},
{
"entropy": 1.0525815039873123,
"epoch": 1.2815533980582523,
"grad_norm": 0.16756953299045563,
"learning_rate": 3.3284079489066725e-05,
"loss": 1.0502808094024658,
"mean_token_accuracy": 0.6859902366995811,
"num_tokens": 12832975.0,
"step": 132
},
{
"entropy": 1.0120011419057846,
"epoch": 1.29126213592233,
"grad_norm": 0.16773994266986847,
"learning_rate": 3.303069834066206e-05,
"loss": 1.0103399753570557,
"mean_token_accuracy": 0.6967930570244789,
"num_tokens": 12930517.0,
"step": 133
},
{
"entropy": 1.042226254940033,
"epoch": 1.3009708737864076,
"grad_norm": 0.17991676926612854,
"learning_rate": 3.2776393954289e-05,
"loss": 1.0408594608306885,
"mean_token_accuracy": 0.6895272880792618,
"num_tokens": 13027442.0,
"step": 134
},
{
"entropy": 1.0453506335616112,
"epoch": 1.3106796116504853,
"grad_norm": 0.16743086278438568,
"learning_rate": 3.252119556569454e-05,
"loss": 1.0410550832748413,
"mean_token_accuracy": 0.6867326200008392,
"num_tokens": 13124793.0,
"step": 135
},
{
"entropy": 1.0293388664722443,
"epoch": 1.3203883495145632,
"grad_norm": 0.16317346692085266,
"learning_rate": 3.226513251340341e-05,
"loss": 1.02403724193573,
"mean_token_accuracy": 0.6924958303570747,
"num_tokens": 13222075.0,
"step": 136
},
{
"entropy": 1.0420408472418785,
"epoch": 1.3300970873786409,
"grad_norm": 0.1733805537223816,
"learning_rate": 3.200823423534519e-05,
"loss": 1.0338948965072632,
"mean_token_accuracy": 0.689193956553936,
"num_tokens": 13319423.0,
"step": 137
},
{
"entropy": 1.042591854929924,
"epoch": 1.3398058252427185,
"grad_norm": 0.17078301310539246,
"learning_rate": 3.175053026547002e-05,
"loss": 1.0373930931091309,
"mean_token_accuracy": 0.6894862800836563,
"num_tokens": 13416786.0,
"step": 138
},
{
"entropy": 1.0242534130811691,
"epoch": 1.3495145631067962,
"grad_norm": 0.17801660299301147,
"learning_rate": 3.149205023035324e-05,
"loss": 1.0228601694107056,
"mean_token_accuracy": 0.6911262944340706,
"num_tokens": 13513688.0,
"step": 139
},
{
"entropy": 1.0496903359889984,
"epoch": 1.3592233009708738,
"grad_norm": 0.17852218449115753,
"learning_rate": 3.123282384578947e-05,
"loss": 1.049614429473877,
"mean_token_accuracy": 0.6867869421839714,
"num_tokens": 13607205.0,
"step": 140
},
{
"entropy": 1.0080739930272102,
"epoch": 1.3689320388349515,
"grad_norm": 0.16432735323905945,
"learning_rate": 3.097288091337635e-05,
"loss": 1.0080070495605469,
"mean_token_accuracy": 0.6958046182990074,
"num_tokens": 13705043.0,
"step": 141
},
{
"entropy": 1.0257286205887794,
"epoch": 1.3786407766990292,
"grad_norm": 0.17122159898281097,
"learning_rate": 3.0712251317088424e-05,
"loss": 1.0299582481384277,
"mean_token_accuracy": 0.6896805837750435,
"num_tokens": 13800688.0,
"step": 142
},
{
"entropy": 0.9992336556315422,
"epoch": 1.3883495145631068,
"grad_norm": 0.2238861322402954,
"learning_rate": 3.0450965019841592e-05,
"loss": 0.99715656042099,
"mean_token_accuracy": 0.6997470483183861,
"num_tokens": 13898532.0,
"step": 143
},
{
"entropy": 1.0371707454323769,
"epoch": 1.3980582524271845,
"grad_norm": 0.17037111520767212,
"learning_rate": 3.018905206004846e-05,
"loss": 1.035717487335205,
"mean_token_accuracy": 0.6881653517484665,
"num_tokens": 13996316.0,
"step": 144
},
{
"entropy": 1.0275786891579628,
"epoch": 1.4077669902912622,
"grad_norm": 0.18156027793884277,
"learning_rate": 2.9926542548165e-05,
"loss": 1.025190830230713,
"mean_token_accuracy": 0.6906291842460632,
"num_tokens": 14093597.0,
"step": 145
},
{
"entropy": 1.0460922569036484,
"epoch": 1.4174757281553398,
"grad_norm": 0.1703980714082718,
"learning_rate": 2.9663466663228978e-05,
"loss": 1.0359042882919312,
"mean_token_accuracy": 0.6888971403241158,
"num_tokens": 14190530.0,
"step": 146
},
{
"entropy": 1.0335627645254135,
"epoch": 1.4271844660194175,
"grad_norm": 0.17414884269237518,
"learning_rate": 2.939985464939043e-05,
"loss": 1.0247759819030762,
"mean_token_accuracy": 0.6912643909454346,
"num_tokens": 14287147.0,
"step": 147
},
{
"entropy": 1.0209672376513481,
"epoch": 1.4368932038834952,
"grad_norm": 0.17711719870567322,
"learning_rate": 2.91357368124347e-05,
"loss": 1.0165073871612549,
"mean_token_accuracy": 0.6936698257923126,
"num_tokens": 14384467.0,
"step": 148
},
{
"entropy": 1.0329503864049911,
"epoch": 1.4466019417475728,
"grad_norm": 0.1697532832622528,
"learning_rate": 2.887114351629839e-05,
"loss": 1.0369350910186768,
"mean_token_accuracy": 0.6886308863759041,
"num_tokens": 14481672.0,
"step": 149
},
{
"entropy": 1.0292729139328003,
"epoch": 1.4563106796116505,
"grad_norm": 0.17358174920082092,
"learning_rate": 2.8606105179578585e-05,
"loss": 1.027604341506958,
"mean_token_accuracy": 0.689355343580246,
"num_tokens": 14579140.0,
"step": 150
},
{
"entropy": 1.0498756989836693,
"epoch": 1.4660194174757282,
"grad_norm": 0.19735999405384064,
"learning_rate": 2.834065227203584e-05,
"loss": 1.0510324239730835,
"mean_token_accuracy": 0.6850913092494011,
"num_tokens": 14675405.0,
"step": 151
},
{
"entropy": 1.0204887762665749,
"epoch": 1.4757281553398058,
"grad_norm": 0.1725974678993225,
"learning_rate": 2.8074815311091263e-05,
"loss": 1.0187439918518066,
"mean_token_accuracy": 0.6918519213795662,
"num_tokens": 14771912.0,
"step": 152
},
{
"entropy": 1.0176549404859543,
"epoch": 1.4854368932038835,
"grad_norm": 0.1712421178817749,
"learning_rate": 2.780862485831814e-05,
"loss": 1.0172964334487915,
"mean_token_accuracy": 0.6932723894715309,
"num_tokens": 14869059.0,
"step": 153
},
{
"entropy": 1.0050822049379349,
"epoch": 1.4951456310679612,
"grad_norm": 0.17614896595478058,
"learning_rate": 2.754211151592841e-05,
"loss": 1.006335973739624,
"mean_token_accuracy": 0.6953242495656013,
"num_tokens": 14966471.0,
"step": 154
},
{
"entropy": 1.0111511871218681,
"epoch": 1.5048543689320388,
"grad_norm": 0.1675221472978592,
"learning_rate": 2.7275305923254606e-05,
"loss": 1.0154767036437988,
"mean_token_accuracy": 0.6931192204356194,
"num_tokens": 15064288.0,
"step": 155
},
{
"entropy": 1.02684336155653,
"epoch": 1.5145631067961165,
"grad_norm": 0.17546917498111725,
"learning_rate": 2.7008238753227383e-05,
"loss": 1.023386001586914,
"mean_token_accuracy": 0.691448763012886,
"num_tokens": 15161784.0,
"step": 156
},
{
"entropy": 1.0204633623361588,
"epoch": 1.5242718446601942,
"grad_norm": 0.175806924700737,
"learning_rate": 2.674094070884926e-05,
"loss": 1.0095469951629639,
"mean_token_accuracy": 0.6962961703538895,
"num_tokens": 15258172.0,
"step": 157
},
{
"entropy": 0.9925187677145004,
"epoch": 1.5339805825242718,
"grad_norm": 0.16857516765594482,
"learning_rate": 2.6473442519664933e-05,
"loss": 0.995888888835907,
"mean_token_accuracy": 0.7000978887081146,
"num_tokens": 15356321.0,
"step": 158
},
{
"entropy": 1.0085221901535988,
"epoch": 1.5436893203883495,
"grad_norm": 0.17279484868049622,
"learning_rate": 2.6205774938228432e-05,
"loss": 1.0096505880355835,
"mean_token_accuracy": 0.6963389366865158,
"num_tokens": 15454280.0,
"step": 159
},
{
"entropy": 1.0388263463974,
"epoch": 1.5533980582524272,
"grad_norm": 0.19317008554935455,
"learning_rate": 2.5937968736567746e-05,
"loss": 1.0307786464691162,
"mean_token_accuracy": 0.6896204799413681,
"num_tokens": 15548567.0,
"step": 160
},
{
"entropy": 1.0248635411262512,
"epoch": 1.5631067961165048,
"grad_norm": 0.285595178604126,
"learning_rate": 2.5670054702647146e-05,
"loss": 1.0265969038009644,
"mean_token_accuracy": 0.6895977482199669,
"num_tokens": 15646127.0,
"step": 161
},
{
"entropy": 1.0066411048173904,
"epoch": 1.5728155339805825,
"grad_norm": 0.1719922423362732,
"learning_rate": 2.540206363682768e-05,
"loss": 1.0009901523590088,
"mean_token_accuracy": 0.6995166838169098,
"num_tokens": 15743035.0,
"step": 162
},
{
"entropy": 1.0152993351221085,
"epoch": 1.5825242718446602,
"grad_norm": 0.17260152101516724,
"learning_rate": 2.513402634832627e-05,
"loss": 1.0113165378570557,
"mean_token_accuracy": 0.6952773109078407,
"num_tokens": 15840620.0,
"step": 163
},
{
"entropy": 1.033155396580696,
"epoch": 1.5922330097087378,
"grad_norm": 0.18080708384513855,
"learning_rate": 2.486597365167374e-05,
"loss": 1.0448689460754395,
"mean_token_accuracy": 0.6873042583465576,
"num_tokens": 15934881.0,
"step": 164
},
{
"entropy": 1.0372785106301308,
"epoch": 1.6019417475728155,
"grad_norm": 0.17866858839988708,
"learning_rate": 2.4597936363172327e-05,
"loss": 1.0408073663711548,
"mean_token_accuracy": 0.6880093738436699,
"num_tokens": 16031255.0,
"step": 165
},
{
"entropy": 1.0505105406045914,
"epoch": 1.6116504854368932,
"grad_norm": 0.17675521969795227,
"learning_rate": 2.4329945297352856e-05,
"loss": 1.0455937385559082,
"mean_token_accuracy": 0.6833712980151176,
"num_tokens": 16128504.0,
"step": 166
},
{
"entropy": 1.07162706553936,
"epoch": 1.6213592233009708,
"grad_norm": 0.17488880455493927,
"learning_rate": 2.4062031263432267e-05,
"loss": 1.0692931413650513,
"mean_token_accuracy": 0.6797295063734055,
"num_tokens": 16225326.0,
"step": 167
},
{
"entropy": 1.04351444542408,
"epoch": 1.6310679611650487,
"grad_norm": 0.17990568280220032,
"learning_rate": 2.379422506177157e-05,
"loss": 1.040710210800171,
"mean_token_accuracy": 0.6852644607424736,
"num_tokens": 16322821.0,
"step": 168
},
{
"entropy": 1.0298245176672935,
"epoch": 1.6407766990291264,
"grad_norm": 0.17780478298664093,
"learning_rate": 2.352655748033508e-05,
"loss": 1.0249665975570679,
"mean_token_accuracy": 0.6916689649224281,
"num_tokens": 16420465.0,
"step": 169
},
{
"entropy": 1.0333473309874535,
"epoch": 1.650485436893204,
"grad_norm": 0.178379625082016,
"learning_rate": 2.3259059291150744e-05,
"loss": 1.0341100692749023,
"mean_token_accuracy": 0.6892575472593307,
"num_tokens": 16517503.0,
"step": 170
},
{
"entropy": 1.0237839594483376,
"epoch": 1.6601941747572817,
"grad_norm": 0.17204873263835907,
"learning_rate": 2.2991761246772623e-05,
"loss": 1.0178446769714355,
"mean_token_accuracy": 0.6930648684501648,
"num_tokens": 16614912.0,
"step": 171
},
{
"entropy": 0.9896853193640709,
"epoch": 1.6699029126213594,
"grad_norm": 0.17218872904777527,
"learning_rate": 2.2724694076745396e-05,
"loss": 0.9850873947143555,
"mean_token_accuracy": 0.7045940905809402,
"num_tokens": 16712592.0,
"step": 172
},
{
"entropy": 1.0385229736566544,
"epoch": 1.679611650485437,
"grad_norm": 0.17635254561901093,
"learning_rate": 2.245788848407159e-05,
"loss": 1.0379856824874878,
"mean_token_accuracy": 0.6906830444931984,
"num_tokens": 16810516.0,
"step": 173
},
{
"entropy": 1.0037900060415268,
"epoch": 1.6893203883495147,
"grad_norm": 0.17268624901771545,
"learning_rate": 2.2191375141681867e-05,
"loss": 0.9993359446525574,
"mean_token_accuracy": 0.6987345814704895,
"num_tokens": 16907482.0,
"step": 174
},
{
"entropy": 0.9959080442786217,
"epoch": 1.6990291262135924,
"grad_norm": 0.18175552785396576,
"learning_rate": 2.1925184688908733e-05,
"loss": 0.9904047250747681,
"mean_token_accuracy": 0.7010570541024208,
"num_tokens": 17004782.0,
"step": 175
},
{
"entropy": 0.9975259378552437,
"epoch": 1.70873786407767,
"grad_norm": 0.17460443079471588,
"learning_rate": 2.165934772796417e-05,
"loss": 0.999598503112793,
"mean_token_accuracy": 0.6996893584728241,
"num_tokens": 17102923.0,
"step": 176
},
{
"entropy": 1.0192040726542473,
"epoch": 1.7184466019417477,
"grad_norm": 0.19032660126686096,
"learning_rate": 2.139389482042142e-05,
"loss": 1.023505449295044,
"mean_token_accuracy": 0.6922990456223488,
"num_tokens": 17199802.0,
"step": 177
},
{
"entropy": 1.008660413324833,
"epoch": 1.7281553398058254,
"grad_norm": 0.18207867443561554,
"learning_rate": 2.1128856483701624e-05,
"loss": 1.008425235748291,
"mean_token_accuracy": 0.6940756440162659,
"num_tokens": 17297366.0,
"step": 178
},
{
"entropy": 1.0423468202352524,
"epoch": 1.737864077669903,
"grad_norm": 0.17587341368198395,
"learning_rate": 2.0864263187565307e-05,
"loss": 1.036442756652832,
"mean_token_accuracy": 0.6883173510432243,
"num_tokens": 17394536.0,
"step": 179
},
{
"entropy": 1.0092622190713882,
"epoch": 1.7475728155339807,
"grad_norm": 0.17515939474105835,
"learning_rate": 2.0600145350609586e-05,
"loss": 1.0126979351043701,
"mean_token_accuracy": 0.6944826990365982,
"num_tokens": 17492516.0,
"step": 180
},
{
"entropy": 1.0159369558095932,
"epoch": 1.7572815533980584,
"grad_norm": 0.18199597299098969,
"learning_rate": 2.033653333677103e-05,
"loss": 1.011486530303955,
"mean_token_accuracy": 0.6935876160860062,
"num_tokens": 17589926.0,
"step": 181
},
{
"entropy": 1.0069985464215279,
"epoch": 1.766990291262136,
"grad_norm": 0.17988887429237366,
"learning_rate": 2.0073457451835e-05,
"loss": 1.0077378749847412,
"mean_token_accuracy": 0.6979865580797195,
"num_tokens": 17686993.0,
"step": 182
},
{
"entropy": 1.0414468497037888,
"epoch": 1.7766990291262137,
"grad_norm": 0.1765284687280655,
"learning_rate": 1.9810947939951546e-05,
"loss": 1.0297632217407227,
"mean_token_accuracy": 0.6888556927442551,
"num_tokens": 17784319.0,
"step": 183
},
{
"entropy": 1.0168253928422928,
"epoch": 1.7864077669902914,
"grad_norm": 0.18019120395183563,
"learning_rate": 1.9549034980158403e-05,
"loss": 1.0034856796264648,
"mean_token_accuracy": 0.6975414827466011,
"num_tokens": 17880977.0,
"step": 184
},
{
"entropy": 1.0029722303152084,
"epoch": 1.796116504854369,
"grad_norm": 0.19301190972328186,
"learning_rate": 1.928774868291158e-05,
"loss": 0.9989402294158936,
"mean_token_accuracy": 0.699431985616684,
"num_tokens": 17978329.0,
"step": 185
},
{
"entropy": 1.0058149993419647,
"epoch": 1.8058252427184467,
"grad_norm": 0.17930394411087036,
"learning_rate": 1.9027119086623645e-05,
"loss": 1.0110243558883667,
"mean_token_accuracy": 0.6958926245570183,
"num_tokens": 18075785.0,
"step": 186
},
{
"entropy": 1.0077807754278183,
"epoch": 1.8155339805825244,
"grad_norm": 0.17985112965106964,
"learning_rate": 1.8767176154210537e-05,
"loss": 1.0201196670532227,
"mean_token_accuracy": 0.6894695311784744,
"num_tokens": 18172695.0,
"step": 187
},
{
"entropy": 1.0128311812877655,
"epoch": 1.825242718446602,
"grad_norm": 0.18074993789196014,
"learning_rate": 1.850794976964677e-05,
"loss": 1.0270740985870361,
"mean_token_accuracy": 0.6907941848039627,
"num_tokens": 18269124.0,
"step": 188
},
{
"entropy": 1.01870559155941,
"epoch": 1.8349514563106797,
"grad_norm": 0.18928128480911255,
"learning_rate": 1.8249469734529994e-05,
"loss": 1.0252387523651123,
"mean_token_accuracy": 0.6926762014627457,
"num_tokens": 18367249.0,
"step": 189
},
{
"entropy": 1.0275882855057716,
"epoch": 1.8446601941747574,
"grad_norm": 0.17471325397491455,
"learning_rate": 1.7991765764654813e-05,
"loss": 1.0264182090759277,
"mean_token_accuracy": 0.6901049017906189,
"num_tokens": 18463910.0,
"step": 190
},
{
"entropy": 1.034515455365181,
"epoch": 1.854368932038835,
"grad_norm": 0.17968705296516418,
"learning_rate": 1.7734867486596594e-05,
"loss": 1.0311692953109741,
"mean_token_accuracy": 0.6873079612851143,
"num_tokens": 18561195.0,
"step": 191
},
{
"entropy": 1.0225220322608948,
"epoch": 1.8640776699029127,
"grad_norm": 0.17145471274852753,
"learning_rate": 1.7478804434305465e-05,
"loss": 1.0082602500915527,
"mean_token_accuracy": 0.6934807673096657,
"num_tokens": 18658873.0,
"step": 192
},
{
"entropy": 1.0166627615690231,
"epoch": 1.8737864077669903,
"grad_norm": 0.17330369353294373,
"learning_rate": 1.7223606045711006e-05,
"loss": 1.0024232864379883,
"mean_token_accuracy": 0.6985119730234146,
"num_tokens": 18755726.0,
"step": 193
},
{
"entropy": 1.028284415602684,
"epoch": 1.883495145631068,
"grad_norm": 0.17851871252059937,
"learning_rate": 1.6969301659337944e-05,
"loss": 1.0232582092285156,
"mean_token_accuracy": 0.6918485462665558,
"num_tokens": 18852964.0,
"step": 194
},
{
"entropy": 1.0244980603456497,
"epoch": 1.8932038834951457,
"grad_norm": 0.17368443310260773,
"learning_rate": 1.6715920510933274e-05,
"loss": 1.020582675933838,
"mean_token_accuracy": 0.6939240843057632,
"num_tokens": 18950306.0,
"step": 195
},
{
"entropy": 1.0173082277178764,
"epoch": 1.9029126213592233,
"grad_norm": 0.17003676295280457,
"learning_rate": 1.646349173010528e-05,
"loss": 1.0092861652374268,
"mean_token_accuracy": 0.6938014999032021,
"num_tokens": 19047745.0,
"step": 196
},
{
"entropy": 1.0060075893998146,
"epoch": 1.912621359223301,
"grad_norm": 0.17336414754390717,
"learning_rate": 1.6212044336974596e-05,
"loss": 1.0132522583007812,
"mean_token_accuracy": 0.6941477060317993,
"num_tokens": 19144506.0,
"step": 197
},
{
"entropy": 1.0209631994366646,
"epoch": 1.9223300970873787,
"grad_norm": 0.17279008030891418,
"learning_rate": 1.596160723883802e-05,
"loss": 1.0216258764266968,
"mean_token_accuracy": 0.6932391673326492,
"num_tokens": 19242731.0,
"step": 198
},
{
"entropy": 0.9829826056957245,
"epoch": 1.9320388349514563,
"grad_norm": 0.17792966961860657,
"learning_rate": 1.57122092268452e-05,
"loss": 0.992206335067749,
"mean_token_accuracy": 0.7004464343190193,
"num_tokens": 19339951.0,
"step": 199
},
{
"entropy": 0.9956350028514862,
"epoch": 1.941747572815534,
"grad_norm": 0.17040826380252838,
"learning_rate": 1.5463878972688705e-05,
"loss": 1.0016891956329346,
"mean_token_accuracy": 0.6970360353589058,
"num_tokens": 19437708.0,
"step": 200
},
{
"entropy": 1.0005292445421219,
"epoch": 1.9514563106796117,
"grad_norm": 0.21164390444755554,
"learning_rate": 1.5216645025307814e-05,
"loss": 1.0097347497940063,
"mean_token_accuracy": 0.6938510239124298,
"num_tokens": 19534829.0,
"step": 201
},
{
"entropy": 1.0144784301519394,
"epoch": 1.9611650485436893,
"grad_norm": 0.17291411757469177,
"learning_rate": 1.4970535807606453e-05,
"loss": 1.0064911842346191,
"mean_token_accuracy": 0.6957991868257523,
"num_tokens": 19632310.0,
"step": 202
},
{
"entropy": 1.0408466532826424,
"epoch": 1.970873786407767,
"grad_norm": 0.2224787026643753,
"learning_rate": 1.4725579613185547e-05,
"loss": 1.0339338779449463,
"mean_token_accuracy": 0.6887135058641434,
"num_tokens": 19730041.0,
"step": 203
},
{
"entropy": 1.0174331441521645,
"epoch": 1.9805825242718447,
"grad_norm": 0.1863594949245453,
"learning_rate": 1.4481804603090357e-05,
"loss": 1.0097577571868896,
"mean_token_accuracy": 0.6938179507851601,
"num_tokens": 19827501.0,
"step": 204
},
{
"entropy": 1.0116109624505043,
"epoch": 1.9902912621359223,
"grad_norm": 0.17445802688598633,
"learning_rate": 1.4239238802572908e-05,
"loss": 1.0059723854064941,
"mean_token_accuracy": 0.6990595534443855,
"num_tokens": 19923357.0,
"step": 205
},
{
"entropy": 1.0056637898087502,
"epoch": 2.0,
"grad_norm": 0.17976193130016327,
"learning_rate": 1.3997910097870165e-05,
"loss": 0.9994570016860962,
"mean_token_accuracy": 0.6946380734443665,
"num_tokens": 20020502.0,
"step": 206
}
],
"logging_steps": 1,
"max_steps": 309,
"num_input_tokens_seen": 0,
"num_train_epochs": 3,
"save_steps": 500,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": false
},
"attributes": {}
}
},
"total_flos": 2.8950470679970447e+18,
"train_batch_size": 1,
"trial_name": null,
"trial_params": null
}