{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 1.0, "eval_steps": 500, "global_step": 103, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "entropy": 1.4083243012428284, "epoch": 0.009708737864077669, "grad_norm": 0.94761723279953, "learning_rate": 0.0, "loss": 1.9706486463546753, "mean_token_accuracy": 0.5420544818043709, "num_tokens": 97105.0, "step": 1 }, { "entropy": 1.421248883008957, "epoch": 0.019417475728155338, "grad_norm": 1.021393060684204, "learning_rate": 3.125e-06, "loss": 2.03873872756958, "mean_token_accuracy": 0.5355476140975952, "num_tokens": 192679.0, "step": 2 }, { "entropy": 1.4670909941196442, "epoch": 0.02912621359223301, "grad_norm": 0.8904154896736145, "learning_rate": 6.25e-06, "loss": 1.994919776916504, "mean_token_accuracy": 0.5325814262032509, "num_tokens": 290599.0, "step": 3 }, { "entropy": 1.5951472371816635, "epoch": 0.038834951456310676, "grad_norm": 0.6973261833190918, "learning_rate": 9.375000000000001e-06, "loss": 1.9966566562652588, "mean_token_accuracy": 0.5266260281205177, "num_tokens": 388130.0, "step": 4 }, { "entropy": 1.6103769689798355, "epoch": 0.04854368932038835, "grad_norm": 0.5392856597900391, "learning_rate": 1.25e-05, "loss": 1.8900949954986572, "mean_token_accuracy": 0.5452185645699501, "num_tokens": 485983.0, "step": 5 }, { "entropy": 1.7284279018640518, "epoch": 0.05825242718446602, "grad_norm": 0.4281271696090698, "learning_rate": 1.5625e-05, "loss": 1.8690071105957031, "mean_token_accuracy": 0.5448430627584457, "num_tokens": 583257.0, "step": 6 }, { "entropy": 1.79091015458107, "epoch": 0.06796116504854369, "grad_norm": 0.4108770191669464, "learning_rate": 1.8750000000000002e-05, "loss": 1.8907827138900757, "mean_token_accuracy": 0.5405718386173248, "num_tokens": 678553.0, "step": 7 }, { "entropy": 1.8500836789608002, "epoch": 0.07766990291262135, "grad_norm": 0.35201919078826904, "learning_rate": 2.1875e-05, "loss": 1.8045190572738647, "mean_token_accuracy": 0.5530312657356262, "num_tokens": 774991.0, "step": 8 }, { "entropy": 1.9261595904827118, "epoch": 0.08737864077669903, "grad_norm": 0.36849886178970337, "learning_rate": 2.5e-05, "loss": 1.7962449789047241, "mean_token_accuracy": 0.5506185740232468, "num_tokens": 871685.0, "step": 9 }, { "entropy": 1.875639259815216, "epoch": 0.0970873786407767, "grad_norm": 0.36218366026878357, "learning_rate": 2.8125000000000003e-05, "loss": 1.703657627105713, "mean_token_accuracy": 0.5688499510288239, "num_tokens": 968934.0, "step": 10 }, { "entropy": 1.8956582099199295, "epoch": 0.10679611650485436, "grad_norm": 0.38436606526374817, "learning_rate": 3.125e-05, "loss": 1.6929868459701538, "mean_token_accuracy": 0.5671246349811554, "num_tokens": 1066190.0, "step": 11 }, { "entropy": 1.9003087729215622, "epoch": 0.11650485436893204, "grad_norm": 0.38454198837280273, "learning_rate": 3.4375e-05, "loss": 1.6784961223602295, "mean_token_accuracy": 0.5702497884631157, "num_tokens": 1163717.0, "step": 12 }, { "entropy": 1.7804109752178192, "epoch": 0.1262135922330097, "grad_norm": 0.34963515400886536, "learning_rate": 3.7500000000000003e-05, "loss": 1.609951376914978, "mean_token_accuracy": 0.5796908214688301, "num_tokens": 1261260.0, "step": 13 }, { "entropy": 1.6776917278766632, "epoch": 0.13592233009708737, "grad_norm": 0.2801634669303894, "learning_rate": 4.0625000000000005e-05, "loss": 1.5957839488983154, "mean_token_accuracy": 0.5835207626223564, "num_tokens": 1358315.0, "step": 14 }, { "entropy": 1.5199688822031021, "epoch": 0.14563106796116504, "grad_norm": 0.27892422676086426, "learning_rate": 4.375e-05, "loss": 1.5371708869934082, "mean_token_accuracy": 0.5937215387821198, "num_tokens": 1455424.0, "step": 15 }, { "entropy": 1.42391437292099, "epoch": 0.1553398058252427, "grad_norm": 0.36465972661972046, "learning_rate": 4.6875e-05, "loss": 1.5261038541793823, "mean_token_accuracy": 0.5960521325469017, "num_tokens": 1552741.0, "step": 16 }, { "entropy": 1.4002629518508911, "epoch": 0.1650485436893204, "grad_norm": 0.33470022678375244, "learning_rate": 5e-05, "loss": 1.506011962890625, "mean_token_accuracy": 0.5978913903236389, "num_tokens": 1650044.0, "step": 17 }, { "entropy": 1.4228239804506302, "epoch": 0.17475728155339806, "grad_norm": 0.24347813427448273, "learning_rate": 4.999856295503635e-05, "loss": 1.4823517799377441, "mean_token_accuracy": 0.599531851708889, "num_tokens": 1747782.0, "step": 18 }, { "entropy": 1.448434516787529, "epoch": 0.18446601941747573, "grad_norm": 0.20727963745594025, "learning_rate": 4.999425198535325e-05, "loss": 1.463187575340271, "mean_token_accuracy": 0.6064818128943443, "num_tokens": 1845724.0, "step": 19 }, { "entropy": 1.4923068583011627, "epoch": 0.1941747572815534, "grad_norm": 0.2315221130847931, "learning_rate": 4.998706758655528e-05, "loss": 1.4465688467025757, "mean_token_accuracy": 0.6043036803603172, "num_tokens": 1943411.0, "step": 20 }, { "entropy": 1.472718134522438, "epoch": 0.20388349514563106, "grad_norm": 0.24738778173923492, "learning_rate": 4.997701058458676e-05, "loss": 1.4063471555709839, "mean_token_accuracy": 0.6147852465510368, "num_tokens": 2041045.0, "step": 21 }, { "entropy": 1.4919932037591934, "epoch": 0.21359223300970873, "grad_norm": 0.21912068128585815, "learning_rate": 4.996408213563684e-05, "loss": 1.4053853750228882, "mean_token_accuracy": 0.6167104989290237, "num_tokens": 2138535.0, "step": 22 }, { "entropy": 1.4844385087490082, "epoch": 0.22330097087378642, "grad_norm": 0.22786955535411835, "learning_rate": 4.994828372600649e-05, "loss": 1.3828628063201904, "mean_token_accuracy": 0.6216765120625496, "num_tokens": 2235538.0, "step": 23 }, { "entropy": 1.4436479061841965, "epoch": 0.23300970873786409, "grad_norm": 0.19272480905056, "learning_rate": 4.9929617171937724e-05, "loss": 1.3706296682357788, "mean_token_accuracy": 0.6209864541888237, "num_tokens": 2332954.0, "step": 24 }, { "entropy": 1.4084927588701248, "epoch": 0.24271844660194175, "grad_norm": 0.17803719639778137, "learning_rate": 4.9908084619404735e-05, "loss": 1.3561553955078125, "mean_token_accuracy": 0.6240377500653267, "num_tokens": 2431031.0, "step": 25 }, { "entropy": 1.3695293813943863, "epoch": 0.2524271844660194, "grad_norm": 0.1710546761751175, "learning_rate": 4.988368854386722e-05, "loss": 1.3544114828109741, "mean_token_accuracy": 0.6251663640141487, "num_tokens": 2527933.0, "step": 26 }, { "entropy": 1.2857100814580917, "epoch": 0.2621359223300971, "grad_norm": 0.18847821652889252, "learning_rate": 4.985643174998578e-05, "loss": 1.3139867782592773, "mean_token_accuracy": 0.6356627941131592, "num_tokens": 2625130.0, "step": 27 }, { "entropy": 1.280667930841446, "epoch": 0.27184466019417475, "grad_norm": 0.19685013592243195, "learning_rate": 4.982631737129948e-05, "loss": 1.3132545948028564, "mean_token_accuracy": 0.6352921947836876, "num_tokens": 2722735.0, "step": 28 }, { "entropy": 1.3028772920370102, "epoch": 0.2815533980582524, "grad_norm": 0.19354666769504547, "learning_rate": 4.9793348869865616e-05, "loss": 1.3400448560714722, "mean_token_accuracy": 0.6271930709481239, "num_tokens": 2820721.0, "step": 29 }, { "entropy": 1.3173751831054688, "epoch": 0.2912621359223301, "grad_norm": 0.16872914135456085, "learning_rate": 4.9757530035861716e-05, "loss": 1.3304100036621094, "mean_token_accuracy": 0.6323504224419594, "num_tokens": 2918531.0, "step": 30 }, { "entropy": 1.284382238984108, "epoch": 0.30097087378640774, "grad_norm": 0.17004726827144623, "learning_rate": 4.971886498714977e-05, "loss": 1.2796059846878052, "mean_token_accuracy": 0.6409082934260368, "num_tokens": 3014027.0, "step": 31 }, { "entropy": 1.3059177845716476, "epoch": 0.3106796116504854, "grad_norm": 0.17118602991104126, "learning_rate": 4.967735816880286e-05, "loss": 1.2877871990203857, "mean_token_accuracy": 0.6396790593862534, "num_tokens": 3111172.0, "step": 32 }, { "entropy": 1.3147014528512955, "epoch": 0.32038834951456313, "grad_norm": 0.16340142488479614, "learning_rate": 4.963301435259413e-05, "loss": 1.2802796363830566, "mean_token_accuracy": 0.6386668905615807, "num_tokens": 3208860.0, "step": 33 }, { "entropy": 1.3065699636936188, "epoch": 0.3300970873786408, "grad_norm": 0.1647864431142807, "learning_rate": 4.95858386364482e-05, "loss": 1.2798354625701904, "mean_token_accuracy": 0.6393692642450333, "num_tokens": 3305964.0, "step": 34 }, { "entropy": 1.2940323948860168, "epoch": 0.33980582524271846, "grad_norm": 0.15510039031505585, "learning_rate": 4.9535836443855096e-05, "loss": 1.2712514400482178, "mean_token_accuracy": 0.6405108198523521, "num_tokens": 3403337.0, "step": 35 }, { "entropy": 1.2636306136846542, "epoch": 0.34951456310679613, "grad_norm": 0.16528593003749847, "learning_rate": 4.948301352324673e-05, "loss": 1.2383002042770386, "mean_token_accuracy": 0.6498897895216942, "num_tokens": 3500500.0, "step": 36 }, { "entropy": 1.2304436564445496, "epoch": 0.3592233009708738, "grad_norm": 0.15354204177856445, "learning_rate": 4.942737594733609e-05, "loss": 1.2233033180236816, "mean_token_accuracy": 0.6514501944184303, "num_tokens": 3597306.0, "step": 37 }, { "entropy": 1.2565466612577438, "epoch": 0.36893203883495146, "grad_norm": 0.15500810742378235, "learning_rate": 4.9368930112419e-05, "loss": 1.2482693195343018, "mean_token_accuracy": 0.645413227379322, "num_tokens": 3694352.0, "step": 38 }, { "entropy": 1.2443159818649292, "epoch": 0.3786407766990291, "grad_norm": 0.15541698038578033, "learning_rate": 4.930768273763889e-05, "loss": 1.2520265579223633, "mean_token_accuracy": 0.6438535004854202, "num_tokens": 3792464.0, "step": 39 }, { "entropy": 1.2296875715255737, "epoch": 0.3883495145631068, "grad_norm": 0.15958574414253235, "learning_rate": 4.92436408642143e-05, "loss": 1.2351443767547607, "mean_token_accuracy": 0.6492253467440605, "num_tokens": 3889619.0, "step": 40 }, { "entropy": 1.2195448875427246, "epoch": 0.39805825242718446, "grad_norm": 0.1615312397480011, "learning_rate": 4.917681185462934e-05, "loss": 1.2214652299880981, "mean_token_accuracy": 0.6524631232023239, "num_tokens": 3986630.0, "step": 41 }, { "entropy": 1.2140728384256363, "epoch": 0.4077669902912621, "grad_norm": 0.15110917389392853, "learning_rate": 4.910720339178735e-05, "loss": 1.2222949266433716, "mean_token_accuracy": 0.6521077156066895, "num_tokens": 4083691.0, "step": 42 }, { "entropy": 1.2051743566989899, "epoch": 0.4174757281553398, "grad_norm": 0.1491296887397766, "learning_rate": 4.90348234781276e-05, "loss": 1.2039450407028198, "mean_token_accuracy": 0.654543362557888, "num_tokens": 4181870.0, "step": 43 }, { "entropy": 1.2167726755142212, "epoch": 0.42718446601941745, "grad_norm": 0.1601928472518921, "learning_rate": 4.895968043470532e-05, "loss": 1.2167367935180664, "mean_token_accuracy": 0.65306556224823, "num_tokens": 4277672.0, "step": 44 }, { "entropy": 1.1795921474695206, "epoch": 0.4368932038834951, "grad_norm": 0.14628776907920837, "learning_rate": 4.8881782900235094e-05, "loss": 1.1818878650665283, "mean_token_accuracy": 0.6603984162211418, "num_tokens": 4375365.0, "step": 45 }, { "entropy": 1.2080871313810349, "epoch": 0.44660194174757284, "grad_norm": 0.15034087002277374, "learning_rate": 4.880113983009768e-05, "loss": 1.2044813632965088, "mean_token_accuracy": 0.6534772142767906, "num_tokens": 4472689.0, "step": 46 }, { "entropy": 1.2424661964178085, "epoch": 0.4563106796116505, "grad_norm": 0.14910851418972015, "learning_rate": 4.87177604953105e-05, "loss": 1.2322750091552734, "mean_token_accuracy": 0.6469002515077591, "num_tokens": 4569961.0, "step": 47 }, { "entropy": 1.209616169333458, "epoch": 0.46601941747572817, "grad_norm": 0.14911304414272308, "learning_rate": 4.86316544814618e-05, "loss": 1.2000218629837036, "mean_token_accuracy": 0.6570775136351585, "num_tokens": 4667359.0, "step": 48 }, { "entropy": 1.201382964849472, "epoch": 0.47572815533980584, "grad_norm": 0.17708911001682281, "learning_rate": 4.854283168760868e-05, "loss": 1.1916768550872803, "mean_token_accuracy": 0.6561535075306892, "num_tokens": 4765400.0, "step": 49 }, { "entropy": 1.1911841928958893, "epoch": 0.4854368932038835, "grad_norm": 0.1523158699274063, "learning_rate": 4.8451302325139004e-05, "loss": 1.1832383871078491, "mean_token_accuracy": 0.6573370844125748, "num_tokens": 4863204.0, "step": 50 }, { "entropy": 1.1881461590528488, "epoch": 0.49514563106796117, "grad_norm": 0.15072602033615112, "learning_rate": 4.835707691659753e-05, "loss": 1.1761033535003662, "mean_token_accuracy": 0.6590301543474197, "num_tokens": 4960926.0, "step": 51 }, { "entropy": 1.1763849258422852, "epoch": 0.5048543689320388, "grad_norm": 0.15600641071796417, "learning_rate": 4.8260166294476164e-05, "loss": 1.1728320121765137, "mean_token_accuracy": 0.6621676161885262, "num_tokens": 5058013.0, "step": 52 }, { "entropy": 1.1916624307632446, "epoch": 0.5145631067961165, "grad_norm": 0.15378843247890472, "learning_rate": 4.8160581599968625e-05, "loss": 1.184821367263794, "mean_token_accuracy": 0.6572789996862411, "num_tokens": 5153970.0, "step": 53 }, { "entropy": 1.1805166453123093, "epoch": 0.5242718446601942, "grad_norm": 0.15211763978004456, "learning_rate": 4.8058334281689595e-05, "loss": 1.1789004802703857, "mean_token_accuracy": 0.658557578921318, "num_tokens": 5251276.0, "step": 54 }, { "entropy": 1.1733617633581161, "epoch": 0.5339805825242718, "grad_norm": 0.15024270117282867, "learning_rate": 4.7953436094358595e-05, "loss": 1.1704764366149902, "mean_token_accuracy": 0.6585692763328552, "num_tokens": 5348605.0, "step": 55 }, { "entropy": 1.1367567777633667, "epoch": 0.5436893203883495, "grad_norm": 0.14717121422290802, "learning_rate": 4.784589909744855e-05, "loss": 1.1350934505462646, "mean_token_accuracy": 0.6707980632781982, "num_tokens": 5446513.0, "step": 56 }, { "entropy": 1.1633624881505966, "epoch": 0.5533980582524272, "grad_norm": 0.15170669555664062, "learning_rate": 4.7735735653799463e-05, "loss": 1.1654052734375, "mean_token_accuracy": 0.6653316840529442, "num_tokens": 5543963.0, "step": 57 }, { "entropy": 1.1694072782993317, "epoch": 0.5631067961165048, "grad_norm": 0.14897707104682922, "learning_rate": 4.762295842819707e-05, "loss": 1.1644500494003296, "mean_token_accuracy": 0.6641355082392693, "num_tokens": 5641181.0, "step": 58 }, { "entropy": 1.1587684005498886, "epoch": 0.5728155339805825, "grad_norm": 0.14866051077842712, "learning_rate": 4.75075803859169e-05, "loss": 1.1571202278137207, "mean_token_accuracy": 0.6645473390817642, "num_tokens": 5738020.0, "step": 59 }, { "entropy": 1.1717360317707062, "epoch": 0.5825242718446602, "grad_norm": 0.15497078001499176, "learning_rate": 4.7389614791233726e-05, "loss": 1.1673715114593506, "mean_token_accuracy": 0.662636861205101, "num_tokens": 5835528.0, "step": 60 }, { "entropy": 1.1693744212388992, "epoch": 0.5922330097087378, "grad_norm": 0.15867234766483307, "learning_rate": 4.726907520589664e-05, "loss": 1.1548094749450684, "mean_token_accuracy": 0.6624177768826485, "num_tokens": 5933622.0, "step": 61 }, { "entropy": 1.1339199990034103, "epoch": 0.6019417475728155, "grad_norm": 0.15212447941303253, "learning_rate": 4.714597548756996e-05, "loss": 1.1325181722640991, "mean_token_accuracy": 0.6707736179232597, "num_tokens": 6030609.0, "step": 62 }, { "entropy": 1.1296663135290146, "epoch": 0.6116504854368932, "grad_norm": 0.15575166046619415, "learning_rate": 4.702032978824011e-05, "loss": 1.1267575025558472, "mean_token_accuracy": 0.6701638028025627, "num_tokens": 6127908.0, "step": 63 }, { "entropy": 1.1318050771951675, "epoch": 0.6213592233009708, "grad_norm": 0.15813998878002167, "learning_rate": 4.6892152552588655e-05, "loss": 1.1390020847320557, "mean_token_accuracy": 0.6672858372330666, "num_tokens": 6225260.0, "step": 64 }, { "entropy": 1.1477476954460144, "epoch": 0.6310679611650486, "grad_norm": 0.15706756711006165, "learning_rate": 4.6761458516331655e-05, "loss": 1.153120994567871, "mean_token_accuracy": 0.663187600672245, "num_tokens": 6322811.0, "step": 65 }, { "entropy": 1.133908674120903, "epoch": 0.6407766990291263, "grad_norm": 0.1579563319683075, "learning_rate": 4.662826270452565e-05, "loss": 1.1408581733703613, "mean_token_accuracy": 0.6672231107950211, "num_tokens": 6419134.0, "step": 66 }, { "entropy": 1.150125876069069, "epoch": 0.6504854368932039, "grad_norm": 0.15973767638206482, "learning_rate": 4.649258042984026e-05, "loss": 1.1557530164718628, "mean_token_accuracy": 0.6634695678949356, "num_tokens": 6516137.0, "step": 67 }, { "entropy": 1.124921292066574, "epoch": 0.6601941747572816, "grad_norm": 0.15293626487255096, "learning_rate": 4.6354427290797875e-05, "loss": 1.1272459030151367, "mean_token_accuracy": 0.6693216189742088, "num_tokens": 6613796.0, "step": 68 }, { "entropy": 1.1551329046487808, "epoch": 0.6699029126213593, "grad_norm": 0.15234892070293427, "learning_rate": 4.621381916998029e-05, "loss": 1.1462955474853516, "mean_token_accuracy": 0.6653169468045235, "num_tokens": 6711660.0, "step": 69 }, { "entropy": 1.1397110670804977, "epoch": 0.6796116504854369, "grad_norm": 0.15561261773109436, "learning_rate": 4.607077223220285e-05, "loss": 1.1248576641082764, "mean_token_accuracy": 0.6719892099499702, "num_tokens": 6808587.0, "step": 70 }, { "entropy": 1.1522215157747269, "epoch": 0.6893203883495146, "grad_norm": 0.1659662127494812, "learning_rate": 4.592530292265609e-05, "loss": 1.1409823894500732, "mean_token_accuracy": 0.6674581989645958, "num_tokens": 6906120.0, "step": 71 }, { "entropy": 1.1350633352994919, "epoch": 0.6990291262135923, "grad_norm": 0.15686708688735962, "learning_rate": 4.5777427965015096e-05, "loss": 1.128638744354248, "mean_token_accuracy": 0.6704377010464668, "num_tokens": 7004058.0, "step": 72 }, { "entropy": 1.1182153522968292, "epoch": 0.7087378640776699, "grad_norm": 0.15111538767814636, "learning_rate": 4.562716435951692e-05, "loss": 1.1166245937347412, "mean_token_accuracy": 0.6737237125635147, "num_tokens": 7101920.0, "step": 73 }, { "entropy": 1.1188742965459824, "epoch": 0.7184466019417476, "grad_norm": 0.15409265458583832, "learning_rate": 4.5474529381006146e-05, "loss": 1.118614673614502, "mean_token_accuracy": 0.6710415109992027, "num_tokens": 7198756.0, "step": 74 }, { "entropy": 1.1149023473262787, "epoch": 0.7281553398058253, "grad_norm": 0.16151487827301025, "learning_rate": 4.531954057694897e-05, "loss": 1.1311017274856567, "mean_token_accuracy": 0.6720475554466248, "num_tokens": 7296339.0, "step": 75 }, { "entropy": 1.1312980204820633, "epoch": 0.7378640776699029, "grad_norm": 0.1549658626317978, "learning_rate": 4.516221576541581e-05, "loss": 1.1340723037719727, "mean_token_accuracy": 0.6688062027096748, "num_tokens": 7393950.0, "step": 76 }, { "entropy": 1.1147898435592651, "epoch": 0.7475728155339806, "grad_norm": 0.15624849498271942, "learning_rate": 4.5002573033032904e-05, "loss": 1.1091203689575195, "mean_token_accuracy": 0.674225278198719, "num_tokens": 7489205.0, "step": 77 }, { "entropy": 1.137469932436943, "epoch": 0.7572815533980582, "grad_norm": 0.16516146063804626, "learning_rate": 4.484063073290301e-05, "loss": 1.1193323135375977, "mean_token_accuracy": 0.6739235296845436, "num_tokens": 7584161.0, "step": 78 }, { "entropy": 1.1054588705301285, "epoch": 0.7669902912621359, "grad_norm": 0.15215378999710083, "learning_rate": 4.467640748249548e-05, "loss": 1.1007866859436035, "mean_token_accuracy": 0.6783005967736244, "num_tokens": 7681353.0, "step": 79 }, { "entropy": 1.0961224287748337, "epoch": 0.7766990291262136, "grad_norm": 0.15287643671035767, "learning_rate": 4.4509922161505926e-05, "loss": 1.0958147048950195, "mean_token_accuracy": 0.676163524389267, "num_tokens": 7778582.0, "step": 80 }, { "entropy": 1.1254196166992188, "epoch": 0.7864077669902912, "grad_norm": 0.16113276779651642, "learning_rate": 4.4341193909685686e-05, "loss": 1.130951166152954, "mean_token_accuracy": 0.6697586253285408, "num_tokens": 7874950.0, "step": 81 }, { "entropy": 1.0993820428848267, "epoch": 0.7961165048543689, "grad_norm": 0.1620422899723053, "learning_rate": 4.417024212464152e-05, "loss": 1.1005873680114746, "mean_token_accuracy": 0.6766335293650627, "num_tokens": 7971956.0, "step": 82 }, { "entropy": 1.1041197627782822, "epoch": 0.8058252427184466, "grad_norm": 0.15546955168247223, "learning_rate": 4.399708645960559e-05, "loss": 1.10465407371521, "mean_token_accuracy": 0.674575038254261, "num_tokens": 8068461.0, "step": 83 }, { "entropy": 1.0924506783485413, "epoch": 0.8155339805825242, "grad_norm": 0.16429384052753448, "learning_rate": 4.382174682117598e-05, "loss": 1.093902587890625, "mean_token_accuracy": 0.6806196495890617, "num_tokens": 8166250.0, "step": 84 }, { "entropy": 1.1175890564918518, "epoch": 0.8252427184466019, "grad_norm": 0.1590225100517273, "learning_rate": 4.364424336702825e-05, "loss": 1.1183996200561523, "mean_token_accuracy": 0.6712751016020775, "num_tokens": 8263412.0, "step": 85 }, { "entropy": 1.091995120048523, "epoch": 0.8349514563106796, "grad_norm": 0.16027086973190308, "learning_rate": 4.346459650359798e-05, "loss": 1.089324951171875, "mean_token_accuracy": 0.6779745444655418, "num_tokens": 8361054.0, "step": 86 }, { "entropy": 1.1091380715370178, "epoch": 0.8446601941747572, "grad_norm": 0.16367396712303162, "learning_rate": 4.328282688373479e-05, "loss": 1.1101912260055542, "mean_token_accuracy": 0.6726596802473068, "num_tokens": 8458058.0, "step": 87 }, { "entropy": 1.1332892328500748, "epoch": 0.8543689320388349, "grad_norm": 0.16062098741531372, "learning_rate": 4.3098955404328045e-05, "loss": 1.1345933675765991, "mean_token_accuracy": 0.669020764529705, "num_tokens": 8552707.0, "step": 88 }, { "entropy": 1.124135971069336, "epoch": 0.8640776699029126, "grad_norm": 0.15737071633338928, "learning_rate": 4.29130032039044e-05, "loss": 1.1120331287384033, "mean_token_accuracy": 0.6742131784558296, "num_tokens": 8648715.0, "step": 89 }, { "entropy": 1.11882945895195, "epoch": 0.8737864077669902, "grad_norm": 0.15959268808364868, "learning_rate": 4.272499166019771e-05, "loss": 1.117668628692627, "mean_token_accuracy": 0.6719657182693481, "num_tokens": 8744790.0, "step": 90 }, { "entropy": 1.1137337386608124, "epoch": 0.883495145631068, "grad_norm": 0.1567354053258896, "learning_rate": 4.253494238769134e-05, "loss": 1.10910165309906, "mean_token_accuracy": 0.6751311644911766, "num_tokens": 8841963.0, "step": 91 }, { "entropy": 1.0963155031204224, "epoch": 0.8932038834951457, "grad_norm": 0.16550451517105103, "learning_rate": 4.234287723513326e-05, "loss": 1.0936603546142578, "mean_token_accuracy": 0.6774952635169029, "num_tokens": 8938823.0, "step": 92 }, { "entropy": 1.1137651056051254, "epoch": 0.9029126213592233, "grad_norm": 0.15746837854385376, "learning_rate": 4.2148818283024304e-05, "loss": 1.11457097530365, "mean_token_accuracy": 0.6719932034611702, "num_tokens": 9036976.0, "step": 93 }, { "entropy": 1.085622027516365, "epoch": 0.912621359223301, "grad_norm": 0.16476289927959442, "learning_rate": 4.195278784107964e-05, "loss": 1.086329460144043, "mean_token_accuracy": 0.677251435816288, "num_tokens": 9134903.0, "step": 94 }, { "entropy": 1.1134615540504456, "epoch": 0.9223300970873787, "grad_norm": 0.16442131996154785, "learning_rate": 4.175480844566404e-05, "loss": 1.1127569675445557, "mean_token_accuracy": 0.6718188151717186, "num_tokens": 9231494.0, "step": 95 }, { "entropy": 1.1019631028175354, "epoch": 0.9320388349514563, "grad_norm": 0.15546253323554993, "learning_rate": 4.1554902857200924e-05, "loss": 1.0951738357543945, "mean_token_accuracy": 0.6784623265266418, "num_tokens": 9328418.0, "step": 96 }, { "entropy": 1.0921340584754944, "epoch": 0.941747572815534, "grad_norm": 0.16863901913166046, "learning_rate": 4.135309405755583e-05, "loss": 1.0979890823364258, "mean_token_accuracy": 0.6765805631875992, "num_tokens": 9426256.0, "step": 97 }, { "entropy": 1.104684755206108, "epoch": 0.9514563106796117, "grad_norm": 0.16420894861221313, "learning_rate": 4.11494052473943e-05, "loss": 1.106919765472412, "mean_token_accuracy": 0.6736476495862007, "num_tokens": 9523841.0, "step": 98 }, { "entropy": 1.0703193694353104, "epoch": 0.9611650485436893, "grad_norm": 0.1605386883020401, "learning_rate": 4.094385984351462e-05, "loss": 1.0785481929779053, "mean_token_accuracy": 0.6812796592712402, "num_tokens": 9621225.0, "step": 99 }, { "entropy": 1.090438723564148, "epoch": 0.970873786407767, "grad_norm": 0.15666428208351135, "learning_rate": 4.073648147615579e-05, "loss": 1.0910429954528809, "mean_token_accuracy": 0.6792959794402122, "num_tokens": 9718805.0, "step": 100 }, { "entropy": 1.1004114151000977, "epoch": 0.9805825242718447, "grad_norm": 0.16704976558685303, "learning_rate": 4.052729398628089e-05, "loss": 1.0998764038085938, "mean_token_accuracy": 0.6745198145508766, "num_tokens": 9816814.0, "step": 101 }, { "entropy": 1.0953031778335571, "epoch": 0.9902912621359223, "grad_norm": 0.16081705689430237, "learning_rate": 4.031632142283622e-05, "loss": 1.0844577550888062, "mean_token_accuracy": 0.6796873956918716, "num_tokens": 9914411.0, "step": 102 }, { "entropy": 1.0845869928598404, "epoch": 1.0, "grad_norm": 0.16136308014392853, "learning_rate": 4.0103588039986556e-05, "loss": 1.0797569751739502, "mean_token_accuracy": 0.6803081929683685, "num_tokens": 10010251.0, "step": 103 } ], "logging_steps": 1, "max_steps": 309, "num_input_tokens_seen": 0, "num_train_epochs": 3, "save_steps": 500, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 1.4475135272615936e+18, "train_batch_size": 1, "trial_name": null, "trial_params": null }