{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 1.0, "eval_steps": 500, "global_step": 103, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "entropy": 1.3063052594661713, "epoch": 0.009708737864077669, "grad_norm": 1.3077822923660278, "learning_rate": 0.0, "loss": 2.1177937984466553, "mean_token_accuracy": 0.5264865458011627, "num_tokens": 96695.0, "step": 1 }, { "entropy": 1.3945444822311401, "epoch": 0.019417475728155338, "grad_norm": 1.4227101802825928, "learning_rate": 3.125e-06, "loss": 2.264981746673584, "mean_token_accuracy": 0.49969692155718803, "num_tokens": 193992.0, "step": 2 }, { "entropy": 1.3749237358570099, "epoch": 0.02912621359223301, "grad_norm": 1.1497575044631958, "learning_rate": 6.25e-06, "loss": 2.0460948944091797, "mean_token_accuracy": 0.5287926904857159, "num_tokens": 291993.0, "step": 3 }, { "entropy": 1.4135093837976456, "epoch": 0.038834951456310676, "grad_norm": 1.0101280212402344, "learning_rate": 9.375000000000001e-06, "loss": 2.0115394592285156, "mean_token_accuracy": 0.5312202051281929, "num_tokens": 389906.0, "step": 4 }, { "entropy": 1.5345965921878815, "epoch": 0.04854368932038835, "grad_norm": 0.8249343037605286, "learning_rate": 1.25e-05, "loss": 1.9907541275024414, "mean_token_accuracy": 0.5317840278148651, "num_tokens": 487090.0, "step": 5 }, { "entropy": 1.628997579216957, "epoch": 0.05825242718446602, "grad_norm": 0.6037535071372986, "learning_rate": 1.5625e-05, "loss": 1.917801856994629, "mean_token_accuracy": 0.541858084499836, "num_tokens": 584439.0, "step": 6 }, { "entropy": 1.8246440291404724, "epoch": 0.06796116504854369, "grad_norm": 0.3977610468864441, "learning_rate": 1.8750000000000002e-05, "loss": 1.8268287181854248, "mean_token_accuracy": 0.5501810759305954, "num_tokens": 681933.0, "step": 7 }, { "entropy": 1.9396448135375977, "epoch": 0.07766990291262135, "grad_norm": 0.47858306765556335, "learning_rate": 2.1875e-05, "loss": 1.7852939367294312, "mean_token_accuracy": 0.5552558451890945, "num_tokens": 777167.0, "step": 8 }, { "entropy": 1.9606482535600662, "epoch": 0.08737864077669903, "grad_norm": 0.5253126621246338, "learning_rate": 2.5e-05, "loss": 1.7283756732940674, "mean_token_accuracy": 0.5672201961278915, "num_tokens": 875080.0, "step": 9 }, { "entropy": 1.9720240384340286, "epoch": 0.0970873786407767, "grad_norm": 0.5374228954315186, "learning_rate": 2.8125000000000003e-05, "loss": 1.711395263671875, "mean_token_accuracy": 0.5681185722351074, "num_tokens": 973099.0, "step": 10 }, { "entropy": 1.82131689786911, "epoch": 0.10679611650485436, "grad_norm": 0.43059229850769043, "learning_rate": 3.125e-05, "loss": 1.6381919384002686, "mean_token_accuracy": 0.5789104923605919, "num_tokens": 1070082.0, "step": 11 }, { "entropy": 1.6750145703554153, "epoch": 0.11650485436893204, "grad_norm": 0.335764616727829, "learning_rate": 3.4375e-05, "loss": 1.5634382963180542, "mean_token_accuracy": 0.5890125557780266, "num_tokens": 1167345.0, "step": 12 }, { "entropy": 1.616977572441101, "epoch": 0.1262135922330097, "grad_norm": 0.29735782742500305, "learning_rate": 3.7500000000000003e-05, "loss": 1.59102201461792, "mean_token_accuracy": 0.5816583260893822, "num_tokens": 1265097.0, "step": 13 }, { "entropy": 1.5444462895393372, "epoch": 0.13592233009708737, "grad_norm": 0.29059097170829773, "learning_rate": 4.0625000000000005e-05, "loss": 1.574419379234314, "mean_token_accuracy": 0.5849687159061432, "num_tokens": 1362414.0, "step": 14 }, { "entropy": 1.4560510218143463, "epoch": 0.14563106796116504, "grad_norm": 0.2826174199581146, "learning_rate": 4.375e-05, "loss": 1.5245388746261597, "mean_token_accuracy": 0.5940257161855698, "num_tokens": 1458384.0, "step": 15 }, { "entropy": 1.4310729652643204, "epoch": 0.1553398058252427, "grad_norm": 0.2571217119693756, "learning_rate": 4.6875e-05, "loss": 1.493829607963562, "mean_token_accuracy": 0.5997192710638046, "num_tokens": 1555321.0, "step": 16 }, { "entropy": 1.3802899718284607, "epoch": 0.1650485436893204, "grad_norm": 0.24408026039600372, "learning_rate": 5e-05, "loss": 1.4393625259399414, "mean_token_accuracy": 0.6103221923112869, "num_tokens": 1652989.0, "step": 17 }, { "entropy": 1.423762321472168, "epoch": 0.17475728155339806, "grad_norm": 0.260315865278244, "learning_rate": 4.999856295503635e-05, "loss": 1.4357669353485107, "mean_token_accuracy": 0.6085835695266724, "num_tokens": 1749968.0, "step": 18 }, { "entropy": 1.4223755896091461, "epoch": 0.18446601941747573, "grad_norm": 0.26641297340393066, "learning_rate": 4.999425198535325e-05, "loss": 1.4089168310165405, "mean_token_accuracy": 0.6123870462179184, "num_tokens": 1847337.0, "step": 19 }, { "entropy": 1.4421514868736267, "epoch": 0.1941747572815534, "grad_norm": 0.2118070274591446, "learning_rate": 4.998706758655528e-05, "loss": 1.4083303213119507, "mean_token_accuracy": 0.6158460900187492, "num_tokens": 1944252.0, "step": 20 }, { "entropy": 1.3758682906627655, "epoch": 0.20388349514563106, "grad_norm": 0.21211183071136475, "learning_rate": 4.997701058458676e-05, "loss": 1.3528016805648804, "mean_token_accuracy": 0.6290531530976295, "num_tokens": 2041362.0, "step": 21 }, { "entropy": 1.3912087827920914, "epoch": 0.21359223300970873, "grad_norm": 0.20889078080654144, "learning_rate": 4.996408213563684e-05, "loss": 1.3577451705932617, "mean_token_accuracy": 0.6254735365509987, "num_tokens": 2139370.0, "step": 22 }, { "entropy": 1.3215357810258865, "epoch": 0.22330097087378642, "grad_norm": 0.20261520147323608, "learning_rate": 4.994828372600649e-05, "loss": 1.300628662109375, "mean_token_accuracy": 0.6371148228645325, "num_tokens": 2233615.0, "step": 23 }, { "entropy": 1.3306704312562943, "epoch": 0.23300970873786409, "grad_norm": 0.19877074658870697, "learning_rate": 4.9929617171937724e-05, "loss": 1.3034857511520386, "mean_token_accuracy": 0.6345249861478806, "num_tokens": 2330947.0, "step": 24 }, { "entropy": 1.3362696319818497, "epoch": 0.24271844660194175, "grad_norm": 0.17692981660366058, "learning_rate": 4.9908084619404735e-05, "loss": 1.3098223209381104, "mean_token_accuracy": 0.6328666806221008, "num_tokens": 2428936.0, "step": 25 }, { "entropy": 1.3557860553264618, "epoch": 0.2524271844660194, "grad_norm": 0.19237112998962402, "learning_rate": 4.988368854386722e-05, "loss": 1.3239411115646362, "mean_token_accuracy": 0.6320360824465752, "num_tokens": 2526310.0, "step": 26 }, { "entropy": 1.32492034137249, "epoch": 0.2621359223300971, "grad_norm": 0.19819748401641846, "learning_rate": 4.985643174998578e-05, "loss": 1.3037995100021362, "mean_token_accuracy": 0.6353878080844879, "num_tokens": 2623215.0, "step": 27 }, { "entropy": 1.2510884702205658, "epoch": 0.27184466019417475, "grad_norm": 0.17776808142662048, "learning_rate": 4.982631737129948e-05, "loss": 1.2440943717956543, "mean_token_accuracy": 0.6481084004044533, "num_tokens": 2720683.0, "step": 28 }, { "entropy": 1.287326768040657, "epoch": 0.2815533980582524, "grad_norm": 0.17891287803649902, "learning_rate": 4.9793348869865616e-05, "loss": 1.29865300655365, "mean_token_accuracy": 0.6353446468710899, "num_tokens": 2818153.0, "step": 29 }, { "entropy": 1.2316195368766785, "epoch": 0.2912621359223301, "grad_norm": 0.17647312581539154, "learning_rate": 4.9757530035861716e-05, "loss": 1.253545880317688, "mean_token_accuracy": 0.6457989513874054, "num_tokens": 2915748.0, "step": 30 }, { "entropy": 1.169528603553772, "epoch": 0.30097087378640774, "grad_norm": 0.16643674671649933, "learning_rate": 4.971886498714977e-05, "loss": 1.1838676929473877, "mean_token_accuracy": 0.6634209230542183, "num_tokens": 3013095.0, "step": 31 }, { "entropy": 1.2801441848278046, "epoch": 0.3106796116504854, "grad_norm": 0.17172685265541077, "learning_rate": 4.967735816880286e-05, "loss": 1.2642897367477417, "mean_token_accuracy": 0.6400710195302963, "num_tokens": 3110631.0, "step": 32 }, { "entropy": 1.2720160782337189, "epoch": 0.32038834951456313, "grad_norm": 0.16451463103294373, "learning_rate": 4.963301435259413e-05, "loss": 1.2586028575897217, "mean_token_accuracy": 0.6447242349386215, "num_tokens": 3207970.0, "step": 33 }, { "entropy": 1.2911356091499329, "epoch": 0.3300970873786408, "grad_norm": 0.1695583015680313, "learning_rate": 4.95858386364482e-05, "loss": 1.2504911422729492, "mean_token_accuracy": 0.6436235383152962, "num_tokens": 3305342.0, "step": 34 }, { "entropy": 1.2505649775266647, "epoch": 0.33980582524271846, "grad_norm": 0.1600319743156433, "learning_rate": 4.9535836443855096e-05, "loss": 1.2131391763687134, "mean_token_accuracy": 0.6537701711058617, "num_tokens": 3399739.0, "step": 35 }, { "entropy": 1.1979082226753235, "epoch": 0.34951456310679613, "grad_norm": 0.15272502601146698, "learning_rate": 4.948301352324673e-05, "loss": 1.1704742908477783, "mean_token_accuracy": 0.6647882163524628, "num_tokens": 3497430.0, "step": 36 }, { "entropy": 1.2117689549922943, "epoch": 0.3592233009708738, "grad_norm": 0.15061117708683014, "learning_rate": 4.942737594733609e-05, "loss": 1.1953562498092651, "mean_token_accuracy": 0.6564236953854561, "num_tokens": 3593935.0, "step": 37 }, { "entropy": 1.1917639821767807, "epoch": 0.36893203883495146, "grad_norm": 0.15709325671195984, "learning_rate": 4.9368930112419e-05, "loss": 1.1850690841674805, "mean_token_accuracy": 0.660385861992836, "num_tokens": 3691118.0, "step": 38 }, { "entropy": 1.2446843981742859, "epoch": 0.3786407766990291, "grad_norm": 0.16046260297298431, "learning_rate": 4.930768273763889e-05, "loss": 1.2477033138275146, "mean_token_accuracy": 0.6435192674398422, "num_tokens": 3788648.0, "step": 39 }, { "entropy": 1.2205789387226105, "epoch": 0.3883495145631068, "grad_norm": 0.1660885363817215, "learning_rate": 4.92436408642143e-05, "loss": 1.2170484066009521, "mean_token_accuracy": 0.6503675952553749, "num_tokens": 3886532.0, "step": 40 }, { "entropy": 1.205104410648346, "epoch": 0.39805825242718446, "grad_norm": 0.15774689614772797, "learning_rate": 4.917681185462934e-05, "loss": 1.207252860069275, "mean_token_accuracy": 0.655083142220974, "num_tokens": 3984443.0, "step": 41 }, { "entropy": 1.1894231885671616, "epoch": 0.4077669902912621, "grad_norm": 0.1520465910434723, "learning_rate": 4.910720339178735e-05, "loss": 1.1727756261825562, "mean_token_accuracy": 0.6604171320796013, "num_tokens": 4082127.0, "step": 42 }, { "entropy": 1.1813564747571945, "epoch": 0.4174757281553398, "grad_norm": 0.1579592078924179, "learning_rate": 4.90348234781276e-05, "loss": 1.1708219051361084, "mean_token_accuracy": 0.6622453778982162, "num_tokens": 4179696.0, "step": 43 }, { "entropy": 1.1847212761640549, "epoch": 0.42718446601941745, "grad_norm": 0.16752171516418457, "learning_rate": 4.895968043470532e-05, "loss": 1.1717603206634521, "mean_token_accuracy": 0.6604401022195816, "num_tokens": 4276989.0, "step": 44 }, { "entropy": 1.1232565939426422, "epoch": 0.4368932038834951, "grad_norm": 0.16498398780822754, "learning_rate": 4.8881782900235094e-05, "loss": 1.1282835006713867, "mean_token_accuracy": 0.6696558594703674, "num_tokens": 4374513.0, "step": 45 }, { "entropy": 1.1546286791563034, "epoch": 0.44660194174757284, "grad_norm": 0.16002920269966125, "learning_rate": 4.880113983009768e-05, "loss": 1.163672924041748, "mean_token_accuracy": 0.6636269986629486, "num_tokens": 4472543.0, "step": 46 }, { "entropy": 1.220591351389885, "epoch": 0.4563106796116505, "grad_norm": 0.15611808001995087, "learning_rate": 4.87177604953105e-05, "loss": 1.227357268333435, "mean_token_accuracy": 0.6496708914637566, "num_tokens": 4570196.0, "step": 47 }, { "entropy": 1.1873502284288406, "epoch": 0.46601941747572817, "grad_norm": 0.15429329872131348, "learning_rate": 4.86316544814618e-05, "loss": 1.1806132793426514, "mean_token_accuracy": 0.6577019914984703, "num_tokens": 4667589.0, "step": 48 }, { "entropy": 1.1497704908251762, "epoch": 0.47572815533980584, "grad_norm": 0.14651840925216675, "learning_rate": 4.854283168760868e-05, "loss": 1.132278323173523, "mean_token_accuracy": 0.6702492162585258, "num_tokens": 4765775.0, "step": 49 }, { "entropy": 1.19112890958786, "epoch": 0.4854368932038835, "grad_norm": 0.16413071751594543, "learning_rate": 4.8451302325139004e-05, "loss": 1.1689636707305908, "mean_token_accuracy": 0.6610261425375938, "num_tokens": 4864001.0, "step": 50 }, { "entropy": 1.1795462369918823, "epoch": 0.49514563106796117, "grad_norm": 0.1465304046869278, "learning_rate": 4.835707691659753e-05, "loss": 1.1613165140151978, "mean_token_accuracy": 0.6660530865192413, "num_tokens": 4960993.0, "step": 51 }, { "entropy": 1.1446045935153961, "epoch": 0.5048543689320388, "grad_norm": 0.1478618085384369, "learning_rate": 4.8260166294476164e-05, "loss": 1.1292091608047485, "mean_token_accuracy": 0.6699203625321388, "num_tokens": 5058285.0, "step": 52 }, { "entropy": 1.1335399597883224, "epoch": 0.5145631067961165, "grad_norm": 0.15407773852348328, "learning_rate": 4.8160581599968625e-05, "loss": 1.1282105445861816, "mean_token_accuracy": 0.6706565544009209, "num_tokens": 5155340.0, "step": 53 }, { "entropy": 1.1364393010735512, "epoch": 0.5242718446601942, "grad_norm": 0.15273907780647278, "learning_rate": 4.8058334281689595e-05, "loss": 1.1344889402389526, "mean_token_accuracy": 0.668300211429596, "num_tokens": 5253290.0, "step": 54 }, { "entropy": 1.1561526656150818, "epoch": 0.5339805825242718, "grad_norm": 0.15070948004722595, "learning_rate": 4.7953436094358595e-05, "loss": 1.145023226737976, "mean_token_accuracy": 0.6662660464644432, "num_tokens": 5350631.0, "step": 55 }, { "entropy": 1.1212447136640549, "epoch": 0.5436893203883495, "grad_norm": 0.1489776223897934, "learning_rate": 4.784589909744855e-05, "loss": 1.1079856157302856, "mean_token_accuracy": 0.6758884415030479, "num_tokens": 5447338.0, "step": 56 }, { "entropy": 1.1728671193122864, "epoch": 0.5533980582524272, "grad_norm": 0.1548493206501007, "learning_rate": 4.7735735653799463e-05, "loss": 1.159340739250183, "mean_token_accuracy": 0.6629773899912834, "num_tokens": 5543513.0, "step": 57 }, { "entropy": 1.1602209657430649, "epoch": 0.5631067961165048, "grad_norm": 0.15153397619724274, "learning_rate": 4.762295842819707e-05, "loss": 1.1558430194854736, "mean_token_accuracy": 0.6631080582737923, "num_tokens": 5640853.0, "step": 58 }, { "entropy": 1.167491763830185, "epoch": 0.5728155339805825, "grad_norm": 0.15950381755828857, "learning_rate": 4.75075803859169e-05, "loss": 1.1687371730804443, "mean_token_accuracy": 0.662310965359211, "num_tokens": 5737838.0, "step": 59 }, { "entropy": 1.1121539771556854, "epoch": 0.5825242718446602, "grad_norm": 0.15362070500850677, "learning_rate": 4.7389614791233726e-05, "loss": 1.122381567955017, "mean_token_accuracy": 0.6725770682096481, "num_tokens": 5835215.0, "step": 60 }, { "entropy": 1.1065661907196045, "epoch": 0.5922330097087378, "grad_norm": 0.15264824032783508, "learning_rate": 4.726907520589664e-05, "loss": 1.1158289909362793, "mean_token_accuracy": 0.673554889857769, "num_tokens": 5933071.0, "step": 61 }, { "entropy": 1.1254866421222687, "epoch": 0.6019417475728155, "grad_norm": 0.1510513871908188, "learning_rate": 4.714597548756996e-05, "loss": 1.1177195310592651, "mean_token_accuracy": 0.6726218238472939, "num_tokens": 6030510.0, "step": 62 }, { "entropy": 1.1632820963859558, "epoch": 0.6116504854368932, "grad_norm": 0.15587088465690613, "learning_rate": 4.702032978824011e-05, "loss": 1.1515460014343262, "mean_token_accuracy": 0.6640657410025597, "num_tokens": 6128308.0, "step": 63 }, { "entropy": 1.13534314930439, "epoch": 0.6213592233009708, "grad_norm": 0.15413475036621094, "learning_rate": 4.6892152552588655e-05, "loss": 1.1225864887237549, "mean_token_accuracy": 0.6697054132819176, "num_tokens": 6225307.0, "step": 64 }, { "entropy": 1.1529878377914429, "epoch": 0.6310679611650486, "grad_norm": 0.14912283420562744, "learning_rate": 4.6761458516331655e-05, "loss": 1.137518048286438, "mean_token_accuracy": 0.6690729334950447, "num_tokens": 6322345.0, "step": 65 }, { "entropy": 1.162615068256855, "epoch": 0.6407766990291263, "grad_norm": 0.15968185663223267, "learning_rate": 4.662826270452565e-05, "loss": 1.148972988128662, "mean_token_accuracy": 0.6663458272814751, "num_tokens": 6419830.0, "step": 66 }, { "entropy": 1.1012173295021057, "epoch": 0.6504854368932039, "grad_norm": 0.15278087556362152, "learning_rate": 4.649258042984026e-05, "loss": 1.0935297012329102, "mean_token_accuracy": 0.6765975803136826, "num_tokens": 6517180.0, "step": 67 }, { "entropy": 1.1730160862207413, "epoch": 0.6601941747572816, "grad_norm": 0.15458795428276062, "learning_rate": 4.6354427290797875e-05, "loss": 1.1597059965133667, "mean_token_accuracy": 0.6620247736573219, "num_tokens": 6614441.0, "step": 68 }, { "entropy": 1.1525196582078934, "epoch": 0.6699029126213593, "grad_norm": 0.15900148451328278, "learning_rate": 4.621381916998029e-05, "loss": 1.1408532857894897, "mean_token_accuracy": 0.6672633439302444, "num_tokens": 6711921.0, "step": 69 }, { "entropy": 1.1234073489904404, "epoch": 0.6796116504854369, "grad_norm": 0.9614858031272888, "learning_rate": 4.607077223220285e-05, "loss": 1.1134552955627441, "mean_token_accuracy": 0.6734683215618134, "num_tokens": 6808916.0, "step": 70 }, { "entropy": 1.1003537625074387, "epoch": 0.6893203883495146, "grad_norm": 0.27281081676483154, "learning_rate": 4.592530292265609e-05, "loss": 1.093156337738037, "mean_token_accuracy": 0.677058070898056, "num_tokens": 6905733.0, "step": 71 }, { "entropy": 1.1193806380033493, "epoch": 0.6990291262135923, "grad_norm": 0.15709951519966125, "learning_rate": 4.5777427965015096e-05, "loss": 1.1156103610992432, "mean_token_accuracy": 0.6733296439051628, "num_tokens": 7002459.0, "step": 72 }, { "entropy": 1.0762626677751541, "epoch": 0.7087378640776699, "grad_norm": 0.14975018799304962, "learning_rate": 4.562716435951692e-05, "loss": 1.0788187980651855, "mean_token_accuracy": 0.6805250495672226, "num_tokens": 7100490.0, "step": 73 }, { "entropy": 1.1070052459836006, "epoch": 0.7184466019417476, "grad_norm": 0.163674458861351, "learning_rate": 4.5474529381006146e-05, "loss": 1.1094239950180054, "mean_token_accuracy": 0.6733985841274261, "num_tokens": 7197967.0, "step": 74 }, { "entropy": 1.133701667189598, "epoch": 0.7281553398058253, "grad_norm": 0.16219182312488556, "learning_rate": 4.531954057694897e-05, "loss": 1.131150484085083, "mean_token_accuracy": 0.6676085367798805, "num_tokens": 7292478.0, "step": 75 }, { "entropy": 1.151291936635971, "epoch": 0.7378640776699029, "grad_norm": 0.15997757017612457, "learning_rate": 4.516221576541581e-05, "loss": 1.1296626329421997, "mean_token_accuracy": 0.6666271537542343, "num_tokens": 7389056.0, "step": 76 }, { "entropy": 1.1276646926999092, "epoch": 0.7475728155339806, "grad_norm": 0.16011382639408112, "learning_rate": 4.5002573033032904e-05, "loss": 1.1120346784591675, "mean_token_accuracy": 0.6736837849020958, "num_tokens": 7486257.0, "step": 77 }, { "entropy": 1.115042731165886, "epoch": 0.7572815533980582, "grad_norm": 0.1535303145647049, "learning_rate": 4.484063073290301e-05, "loss": 1.1091301441192627, "mean_token_accuracy": 0.6762245669960976, "num_tokens": 7583265.0, "step": 78 }, { "entropy": 1.087426796555519, "epoch": 0.7669902912621359, "grad_norm": 0.16656380891799927, "learning_rate": 4.467640748249548e-05, "loss": 1.0862419605255127, "mean_token_accuracy": 0.6805471926927567, "num_tokens": 7680175.0, "step": 79 }, { "entropy": 1.1316653937101364, "epoch": 0.7766990291262136, "grad_norm": 0.15928491950035095, "learning_rate": 4.4509922161505926e-05, "loss": 1.1360259056091309, "mean_token_accuracy": 0.6669512763619423, "num_tokens": 7777798.0, "step": 80 }, { "entropy": 1.1151190549135208, "epoch": 0.7864077669902912, "grad_norm": 0.15734143555164337, "learning_rate": 4.4341193909685686e-05, "loss": 1.1140034198760986, "mean_token_accuracy": 0.6693683862686157, "num_tokens": 7875637.0, "step": 81 }, { "entropy": 1.1036027371883392, "epoch": 0.7961165048543689, "grad_norm": 0.16518977284431458, "learning_rate": 4.417024212464152e-05, "loss": 1.0992156267166138, "mean_token_accuracy": 0.6753587499260902, "num_tokens": 7973214.0, "step": 82 }, { "entropy": 1.1240820437669754, "epoch": 0.8058252427184466, "grad_norm": 0.15742117166519165, "learning_rate": 4.399708645960559e-05, "loss": 1.1219127178192139, "mean_token_accuracy": 0.6707674041390419, "num_tokens": 8071015.0, "step": 83 }, { "entropy": 1.0782043635845184, "epoch": 0.8155339805825242, "grad_norm": 0.15135641396045685, "learning_rate": 4.382174682117598e-05, "loss": 1.0685319900512695, "mean_token_accuracy": 0.6833792477846146, "num_tokens": 8167887.0, "step": 84 }, { "entropy": 1.1078387796878815, "epoch": 0.8252427184466019, "grad_norm": 0.15460753440856934, "learning_rate": 4.364424336702825e-05, "loss": 1.1065967082977295, "mean_token_accuracy": 0.6753173843026161, "num_tokens": 8265328.0, "step": 85 }, { "entropy": 1.109467014670372, "epoch": 0.8349514563106796, "grad_norm": 0.15673620998859406, "learning_rate": 4.346459650359798e-05, "loss": 1.1054904460906982, "mean_token_accuracy": 0.6707606092095375, "num_tokens": 8362790.0, "step": 86 }, { "entropy": 1.125985011458397, "epoch": 0.8446601941747572, "grad_norm": 0.1561659872531891, "learning_rate": 4.328282688373479e-05, "loss": 1.111283302307129, "mean_token_accuracy": 0.6752806529402733, "num_tokens": 8460119.0, "step": 87 }, { "entropy": 1.0695659816265106, "epoch": 0.8543689320388349, "grad_norm": 0.16007103025913239, "learning_rate": 4.3098955404328045e-05, "loss": 1.056589961051941, "mean_token_accuracy": 0.6865223124623299, "num_tokens": 8555768.0, "step": 88 }, { "entropy": 1.0883630514144897, "epoch": 0.8640776699029126, "grad_norm": 0.15864451229572296, "learning_rate": 4.29130032039044e-05, "loss": 1.0721038579940796, "mean_token_accuracy": 0.6814716532826424, "num_tokens": 8653989.0, "step": 89 }, { "entropy": 1.0660209506750107, "epoch": 0.8737864077669902, "grad_norm": 0.15096718072891235, "learning_rate": 4.272499166019771e-05, "loss": 1.0504462718963623, "mean_token_accuracy": 0.6850994229316711, "num_tokens": 8751995.0, "step": 90 }, { "entropy": 1.1066109761595726, "epoch": 0.883495145631068, "grad_norm": 0.16408860683441162, "learning_rate": 4.253494238769134e-05, "loss": 1.106789231300354, "mean_token_accuracy": 0.6758328899741173, "num_tokens": 8848370.0, "step": 91 }, { "entropy": 1.0865231901407242, "epoch": 0.8932038834951457, "grad_norm": 0.1649610996246338, "learning_rate": 4.234287723513326e-05, "loss": 1.095716118812561, "mean_token_accuracy": 0.6755226477980614, "num_tokens": 8946065.0, "step": 92 }, { "entropy": 1.0563477203249931, "epoch": 0.9029126213592233, "grad_norm": 0.15605774521827698, "learning_rate": 4.2148818283024304e-05, "loss": 1.0641911029815674, "mean_token_accuracy": 0.684117816388607, "num_tokens": 9043734.0, "step": 93 }, { "entropy": 1.1027402877807617, "epoch": 0.912621359223301, "grad_norm": 0.1745792031288147, "learning_rate": 4.195278784107964e-05, "loss": 1.093820571899414, "mean_token_accuracy": 0.6766936853528023, "num_tokens": 9141101.0, "step": 94 }, { "entropy": 1.1108492761850357, "epoch": 0.9223300970873787, "grad_norm": 0.1714155375957489, "learning_rate": 4.175480844566404e-05, "loss": 1.0948399305343628, "mean_token_accuracy": 0.6759923100471497, "num_tokens": 9238764.0, "step": 95 }, { "entropy": 1.092107117176056, "epoch": 0.9320388349514563, "grad_norm": 0.16130048036575317, "learning_rate": 4.1554902857200924e-05, "loss": 1.0810198783874512, "mean_token_accuracy": 0.6786670908331871, "num_tokens": 9335019.0, "step": 96 }, { "entropy": 1.0851488932967186, "epoch": 0.941747572815534, "grad_norm": 0.16832125186920166, "learning_rate": 4.135309405755583e-05, "loss": 1.073775291442871, "mean_token_accuracy": 0.6807554513216019, "num_tokens": 9433084.0, "step": 97 }, { "entropy": 1.0768142491579056, "epoch": 0.9514563106796117, "grad_norm": 0.16131848096847534, "learning_rate": 4.11494052473943e-05, "loss": 1.0637844800949097, "mean_token_accuracy": 0.6831372752785683, "num_tokens": 9530495.0, "step": 98 }, { "entropy": 1.063091091811657, "epoch": 0.9611650485436893, "grad_norm": 0.16142332553863525, "learning_rate": 4.094385984351462e-05, "loss": 1.0600042343139648, "mean_token_accuracy": 0.6849533692002296, "num_tokens": 9628209.0, "step": 99 }, { "entropy": 1.0749415531754494, "epoch": 0.970873786407767, "grad_norm": 0.18972496688365936, "learning_rate": 4.073648147615579e-05, "loss": 1.0742400884628296, "mean_token_accuracy": 0.6798612177371979, "num_tokens": 9726165.0, "step": 100 }, { "entropy": 1.0456555485725403, "epoch": 0.9805825242718447, "grad_norm": 0.1582217514514923, "learning_rate": 4.052729398628089e-05, "loss": 1.0480663776397705, "mean_token_accuracy": 0.6852379813790321, "num_tokens": 9823616.0, "step": 101 }, { "entropy": 1.0736559927463531, "epoch": 0.9902912621359223, "grad_norm": 0.16985982656478882, "learning_rate": 4.031632142283622e-05, "loss": 1.0799673795700073, "mean_token_accuracy": 0.6796677485108376, "num_tokens": 9921527.0, "step": 102 }, { "entropy": 1.0745692774653435, "epoch": 1.0, "grad_norm": 0.16134285926818848, "learning_rate": 4.0103588039986556e-05, "loss": 1.078010082244873, "mean_token_accuracy": 0.6782025918364525, "num_tokens": 10018894.0, "step": 103 } ], "logging_steps": 1, "max_steps": 309, "num_input_tokens_seen": 0, "num_train_epochs": 3, "save_steps": 500, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 1.4093087033157222e+18, "train_batch_size": 1, "trial_name": null, "trial_params": null }