{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 2.0, "eval_steps": 500, "global_step": 208, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "entropy": 1.2957205325365067, "epoch": 0.009685230024213076, "grad_norm": 0.9995483160018921, "learning_rate": 0.0, "loss": 1.9372434616088867, "mean_token_accuracy": 0.5489737018942833, "num_tokens": 97740.0, "step": 1 }, { "entropy": 1.3194782882928848, "epoch": 0.01937046004842615, "grad_norm": 0.9814075827598572, "learning_rate": 3.125e-06, "loss": 1.95685613155365, "mean_token_accuracy": 0.5466571971774101, "num_tokens": 194347.0, "step": 2 }, { "entropy": 1.3409326374530792, "epoch": 0.029055690072639227, "grad_norm": 0.9050161838531494, "learning_rate": 6.25e-06, "loss": 1.938143253326416, "mean_token_accuracy": 0.5483311638236046, "num_tokens": 292306.0, "step": 3 }, { "entropy": 1.4396293759346008, "epoch": 0.0387409200968523, "grad_norm": 0.7553433775901794, "learning_rate": 9.375000000000001e-06, "loss": 1.9240221977233887, "mean_token_accuracy": 0.5431711822748184, "num_tokens": 389675.0, "step": 4 }, { "entropy": 1.5236343890428543, "epoch": 0.048426150121065374, "grad_norm": 0.5566913485527039, "learning_rate": 1.25e-05, "loss": 1.8870434761047363, "mean_token_accuracy": 0.5487127229571342, "num_tokens": 482548.0, "step": 5 }, { "entropy": 1.587360993027687, "epoch": 0.05811138014527845, "grad_norm": 0.41897791624069214, "learning_rate": 1.5625e-05, "loss": 1.790077567100525, "mean_token_accuracy": 0.5560380145907402, "num_tokens": 579772.0, "step": 6 }, { "entropy": 1.701308086514473, "epoch": 0.06779661016949153, "grad_norm": 0.3749634921550751, "learning_rate": 1.8750000000000002e-05, "loss": 1.7975553274154663, "mean_token_accuracy": 0.5572659820318222, "num_tokens": 677650.0, "step": 7 }, { "entropy": 1.7159235179424286, "epoch": 0.0774818401937046, "grad_norm": 0.32318735122680664, "learning_rate": 2.1875e-05, "loss": 1.726526141166687, "mean_token_accuracy": 0.5642273500561714, "num_tokens": 774231.0, "step": 8 }, { "entropy": 1.828441396355629, "epoch": 0.08716707021791767, "grad_norm": 0.3263152837753296, "learning_rate": 2.5e-05, "loss": 1.7625732421875, "mean_token_accuracy": 0.5538319870829582, "num_tokens": 868913.0, "step": 9 }, { "entropy": 1.8398680537939072, "epoch": 0.09685230024213075, "grad_norm": 0.3322964608669281, "learning_rate": 2.8125000000000003e-05, "loss": 1.6790331602096558, "mean_token_accuracy": 0.5727217048406601, "num_tokens": 966483.0, "step": 10 }, { "entropy": 1.800604209303856, "epoch": 0.10653753026634383, "grad_norm": 0.3253025412559509, "learning_rate": 3.125e-05, "loss": 1.6130985021591187, "mean_token_accuracy": 0.5812065601348877, "num_tokens": 1062677.0, "step": 11 }, { "entropy": 1.8502707928419113, "epoch": 0.1162227602905569, "grad_norm": 0.35978925228118896, "learning_rate": 3.4375e-05, "loss": 1.628458857536316, "mean_token_accuracy": 0.5780329182744026, "num_tokens": 1160086.0, "step": 12 }, { "entropy": 1.7924207001924515, "epoch": 0.12590799031476999, "grad_norm": 0.331644743680954, "learning_rate": 3.7500000000000003e-05, "loss": 1.5732147693634033, "mean_token_accuracy": 0.5900157392024994, "num_tokens": 1257647.0, "step": 13 }, { "entropy": 1.7685164362192154, "epoch": 0.13559322033898305, "grad_norm": 0.326431006193161, "learning_rate": 4.0625000000000005e-05, "loss": 1.5668952465057373, "mean_token_accuracy": 0.5877715274691582, "num_tokens": 1354505.0, "step": 14 }, { "entropy": 1.5795451253652573, "epoch": 0.14527845036319612, "grad_norm": 0.26537618041038513, "learning_rate": 4.375e-05, "loss": 1.4661058187484741, "mean_token_accuracy": 0.6071906611323357, "num_tokens": 1450622.0, "step": 15 }, { "entropy": 1.5185481905937195, "epoch": 0.1549636803874092, "grad_norm": 0.24135415256023407, "learning_rate": 4.6875e-05, "loss": 1.4757945537567139, "mean_token_accuracy": 0.6041631400585175, "num_tokens": 1547908.0, "step": 16 }, { "entropy": 1.4099202752113342, "epoch": 0.16464891041162227, "grad_norm": 0.2752665579319, "learning_rate": 5e-05, "loss": 1.4465235471725464, "mean_token_accuracy": 0.6097583919763565, "num_tokens": 1645426.0, "step": 17 }, { "entropy": 1.3497764021158218, "epoch": 0.17433414043583534, "grad_norm": 0.26331380009651184, "learning_rate": 4.999859193643945e-05, "loss": 1.4109758138656616, "mean_token_accuracy": 0.6169496104121208, "num_tokens": 1742103.0, "step": 18 }, { "entropy": 1.3129477798938751, "epoch": 0.18401937046004843, "grad_norm": 0.25825461745262146, "learning_rate": 4.999436790436924e-05, "loss": 1.3865187168121338, "mean_token_accuracy": 0.6188722252845764, "num_tokens": 1839477.0, "step": 19 }, { "entropy": 1.292990192770958, "epoch": 0.1937046004842615, "grad_norm": 0.19367851316928864, "learning_rate": 4.9987328379605816e-05, "loss": 1.3164660930633545, "mean_token_accuracy": 0.6362323462963104, "num_tokens": 1936962.0, "step": 20 }, { "entropy": 1.376704841852188, "epoch": 0.2033898305084746, "grad_norm": 0.19777517020702362, "learning_rate": 4.9977474155117045e-05, "loss": 1.3734445571899414, "mean_token_accuracy": 0.623312383890152, "num_tokens": 2034780.0, "step": 21 }, { "entropy": 1.3632780611515045, "epoch": 0.21307506053268765, "grad_norm": 0.20455984771251678, "learning_rate": 4.9964806340932865e-05, "loss": 1.3468432426452637, "mean_token_accuracy": 0.6259733065962791, "num_tokens": 2132583.0, "step": 22 }, { "entropy": 1.3963707983493805, "epoch": 0.22276029055690072, "grad_norm": 0.20235121250152588, "learning_rate": 4.9949326364020314e-05, "loss": 1.3420944213867188, "mean_token_accuracy": 0.629428505897522, "num_tokens": 2226009.0, "step": 23 }, { "entropy": 1.3728236258029938, "epoch": 0.2324455205811138, "grad_norm": 0.19748054444789886, "learning_rate": 4.993103596812268e-05, "loss": 1.311779260635376, "mean_token_accuracy": 0.6367133855819702, "num_tokens": 2323884.0, "step": 24 }, { "entropy": 1.3855281174182892, "epoch": 0.24213075060532688, "grad_norm": 0.1842709332704544, "learning_rate": 4.9909937213563165e-05, "loss": 1.3212249279022217, "mean_token_accuracy": 0.6343293562531471, "num_tokens": 2420260.0, "step": 25 }, { "entropy": 1.3564256578683853, "epoch": 0.25181598062953997, "grad_norm": 0.17390435934066772, "learning_rate": 4.988603247701277e-05, "loss": 1.29941725730896, "mean_token_accuracy": 0.6395170390605927, "num_tokens": 2517078.0, "step": 26 }, { "entropy": 1.340470239520073, "epoch": 0.26150121065375304, "grad_norm": 0.16865943372249603, "learning_rate": 4.985932445122257e-05, "loss": 1.305230736732483, "mean_token_accuracy": 0.6346895545721054, "num_tokens": 2614502.0, "step": 27 }, { "entropy": 1.249424859881401, "epoch": 0.2711864406779661, "grad_norm": 0.16522753238677979, "learning_rate": 4.982981614472039e-05, "loss": 1.2451016902923584, "mean_token_accuracy": 0.648459404706955, "num_tokens": 2710926.0, "step": 28 }, { "entropy": 1.241905003786087, "epoch": 0.28087167070217917, "grad_norm": 0.1635328084230423, "learning_rate": 4.979751088147192e-05, "loss": 1.2533214092254639, "mean_token_accuracy": 0.6469609588384628, "num_tokens": 2807646.0, "step": 29 }, { "entropy": 1.2305553704500198, "epoch": 0.29055690072639223, "grad_norm": 0.1724368929862976, "learning_rate": 4.97624123005063e-05, "loss": 1.2500461339950562, "mean_token_accuracy": 0.6472327932715416, "num_tokens": 2905309.0, "step": 30 }, { "entropy": 1.2676000744104385, "epoch": 0.30024213075060535, "grad_norm": 0.1697048544883728, "learning_rate": 4.972452435550614e-05, "loss": 1.2715867757797241, "mean_token_accuracy": 0.6399261504411697, "num_tokens": 3002360.0, "step": 31 }, { "entropy": 1.259141355752945, "epoch": 0.3099273607748184, "grad_norm": 0.1588452011346817, "learning_rate": 4.968385131436222e-05, "loss": 1.2634798288345337, "mean_token_accuracy": 0.6464442312717438, "num_tokens": 3098670.0, "step": 32 }, { "entropy": 1.240147739648819, "epoch": 0.3196125907990315, "grad_norm": 0.16833168268203735, "learning_rate": 4.9640397758692715e-05, "loss": 1.234930396080017, "mean_token_accuracy": 0.6492077708244324, "num_tokens": 3196614.0, "step": 33 }, { "entropy": 1.2283259332180023, "epoch": 0.32929782082324455, "grad_norm": 0.15456287562847137, "learning_rate": 4.9594168583327094e-05, "loss": 1.209458589553833, "mean_token_accuracy": 0.654823787510395, "num_tokens": 3294374.0, "step": 34 }, { "entropy": 1.2569270879030228, "epoch": 0.3389830508474576, "grad_norm": 0.1605941504240036, "learning_rate": 4.954516899575473e-05, "loss": 1.239461898803711, "mean_token_accuracy": 0.6469651088118553, "num_tokens": 3392016.0, "step": 35 }, { "entropy": 1.2405883818864822, "epoch": 0.3486682808716707, "grad_norm": 0.14910897612571716, "learning_rate": 4.949340451553833e-05, "loss": 1.2166962623596191, "mean_token_accuracy": 0.6551224812865257, "num_tokens": 3489070.0, "step": 36 }, { "entropy": 1.215465858578682, "epoch": 0.3583535108958838, "grad_norm": 0.147048220038414, "learning_rate": 4.943888097369216e-05, "loss": 1.2016295194625854, "mean_token_accuracy": 0.6562318950891495, "num_tokens": 3586431.0, "step": 37 }, { "entropy": 1.2163386642932892, "epoch": 0.36803874092009686, "grad_norm": 0.15423355996608734, "learning_rate": 4.938160451202521e-05, "loss": 1.205035924911499, "mean_token_accuracy": 0.6569599062204361, "num_tokens": 3684062.0, "step": 38 }, { "entropy": 1.2028222680091858, "epoch": 0.37772397094430993, "grad_norm": 0.15404321253299713, "learning_rate": 4.9321581582449365e-05, "loss": 1.192380428314209, "mean_token_accuracy": 0.6554796397686005, "num_tokens": 3780819.0, "step": 39 }, { "entropy": 1.2089442908763885, "epoch": 0.387409200968523, "grad_norm": 0.14532388746738434, "learning_rate": 4.9258818946252624e-05, "loss": 1.2102763652801514, "mean_token_accuracy": 0.6531244814395905, "num_tokens": 3878336.0, "step": 40 }, { "entropy": 1.1934202015399933, "epoch": 0.39709443099273606, "grad_norm": 0.1453426033258438, "learning_rate": 4.9193323673337476e-05, "loss": 1.1972005367279053, "mean_token_accuracy": 0.6552818641066551, "num_tokens": 3975553.0, "step": 41 }, { "entropy": 1.1711555123329163, "epoch": 0.4067796610169492, "grad_norm": 0.1477774679660797, "learning_rate": 4.912510314142448e-05, "loss": 1.170544147491455, "mean_token_accuracy": 0.6620478183031082, "num_tokens": 4072191.0, "step": 42 }, { "entropy": 1.1826989650726318, "epoch": 0.41646489104116224, "grad_norm": 0.14542169868946075, "learning_rate": 4.9054165035221236e-05, "loss": 1.1799176931381226, "mean_token_accuracy": 0.6598139330744743, "num_tokens": 4169972.0, "step": 43 }, { "entropy": 1.1880664974451065, "epoch": 0.4261501210653753, "grad_norm": 0.1443413645029068, "learning_rate": 4.898051734555676e-05, "loss": 1.1854431629180908, "mean_token_accuracy": 0.66011131554842, "num_tokens": 4266802.0, "step": 44 }, { "entropy": 1.1752376854419708, "epoch": 0.4358353510895884, "grad_norm": 0.23293092846870422, "learning_rate": 4.890416836848127e-05, "loss": 1.172422170639038, "mean_token_accuracy": 0.6633148416876793, "num_tokens": 4364720.0, "step": 45 }, { "entropy": 1.1703867614269257, "epoch": 0.44552058111380144, "grad_norm": 0.1400470733642578, "learning_rate": 4.88251267043318e-05, "loss": 1.1647189855575562, "mean_token_accuracy": 0.665075309574604, "num_tokens": 4460849.0, "step": 46 }, { "entropy": 1.17378731071949, "epoch": 0.4552058111380145, "grad_norm": 0.1396193504333496, "learning_rate": 4.87434012567633e-05, "loss": 1.1746811866760254, "mean_token_accuracy": 0.6617837771773338, "num_tokens": 4558078.0, "step": 47 }, { "entropy": 1.1466614976525307, "epoch": 0.4648910411622276, "grad_norm": 0.14611490070819855, "learning_rate": 4.865900123174574e-05, "loss": 1.1373505592346191, "mean_token_accuracy": 0.6694466471672058, "num_tokens": 4656144.0, "step": 48 }, { "entropy": 1.1598657816648483, "epoch": 0.4745762711864407, "grad_norm": 0.1434149593114853, "learning_rate": 4.857193613652711e-05, "loss": 1.1583551168441772, "mean_token_accuracy": 0.6666313409805298, "num_tokens": 4752916.0, "step": 49 }, { "entropy": 1.1331430822610855, "epoch": 0.48426150121065376, "grad_norm": 0.13973699510097504, "learning_rate": 4.848221577856243e-05, "loss": 1.1207313537597656, "mean_token_accuracy": 0.6732116788625717, "num_tokens": 4850493.0, "step": 50 }, { "entropy": 1.145334169268608, "epoch": 0.4939467312348668, "grad_norm": 0.13802146911621094, "learning_rate": 4.838985026440905e-05, "loss": 1.134577989578247, "mean_token_accuracy": 0.6739182397723198, "num_tokens": 4948257.0, "step": 51 }, { "entropy": 1.1789843142032623, "epoch": 0.5036319612590799, "grad_norm": 0.14845487475395203, "learning_rate": 4.829484999858815e-05, "loss": 1.1688673496246338, "mean_token_accuracy": 0.6578787639737129, "num_tokens": 5045927.0, "step": 52 }, { "entropy": 1.1895974725484848, "epoch": 0.513317191283293, "grad_norm": 0.1441718488931656, "learning_rate": 4.819722568241274e-05, "loss": 1.1826505661010742, "mean_token_accuracy": 0.6588587313890457, "num_tokens": 5142165.0, "step": 53 }, { "entropy": 1.1316261738538742, "epoch": 0.5230024213075061, "grad_norm": 0.14087459444999695, "learning_rate": 4.8096988312782174e-05, "loss": 1.1231753826141357, "mean_token_accuracy": 0.6710022836923599, "num_tokens": 5239937.0, "step": 54 }, { "entropy": 1.1435543149709702, "epoch": 0.5326876513317191, "grad_norm": 0.14454324543476105, "learning_rate": 4.799414918094347e-05, "loss": 1.1403521299362183, "mean_token_accuracy": 0.6671252995729446, "num_tokens": 5336273.0, "step": 55 }, { "entropy": 1.0858831107616425, "epoch": 0.5423728813559322, "grad_norm": 0.14002826809883118, "learning_rate": 4.788871987121937e-05, "loss": 1.086983561515808, "mean_token_accuracy": 0.6800005808472633, "num_tokens": 5434119.0, "step": 56 }, { "entropy": 1.1357448101043701, "epoch": 0.5520581113801453, "grad_norm": 0.1409410983324051, "learning_rate": 4.77807122597034e-05, "loss": 1.145082950592041, "mean_token_accuracy": 0.6666935756802559, "num_tokens": 5530374.0, "step": 57 }, { "entropy": 1.121580258011818, "epoch": 0.5617433414043583, "grad_norm": 0.14635145664215088, "learning_rate": 4.767013851292212e-05, "loss": 1.134584665298462, "mean_token_accuracy": 0.6697172001004219, "num_tokens": 5627067.0, "step": 58 }, { "entropy": 1.1188838332891464, "epoch": 0.5714285714285714, "grad_norm": 0.14798252284526825, "learning_rate": 4.755701108646463e-05, "loss": 1.128434419631958, "mean_token_accuracy": 0.6693471819162369, "num_tokens": 5721452.0, "step": 59 }, { "entropy": 1.1582091152668, "epoch": 0.5811138014527845, "grad_norm": 0.14457716047763824, "learning_rate": 4.744134272357948e-05, "loss": 1.1655305624008179, "mean_token_accuracy": 0.6602210402488708, "num_tokens": 5818528.0, "step": 60 }, { "entropy": 1.1417238414287567, "epoch": 0.5907990314769975, "grad_norm": 0.1429831087589264, "learning_rate": 4.732314645373921e-05, "loss": 1.1227712631225586, "mean_token_accuracy": 0.6702725440263748, "num_tokens": 5915548.0, "step": 61 }, { "entropy": 1.1103073507547379, "epoch": 0.6004842615012107, "grad_norm": 0.14573390781879425, "learning_rate": 4.7202435591172676e-05, "loss": 1.0962705612182617, "mean_token_accuracy": 0.6774255335330963, "num_tokens": 6011742.0, "step": 62 }, { "entropy": 1.122736319899559, "epoch": 0.6101694915254238, "grad_norm": 0.14568699896335602, "learning_rate": 4.7079223733365237e-05, "loss": 1.108860731124878, "mean_token_accuracy": 0.6744343638420105, "num_tokens": 6108610.0, "step": 63 }, { "entropy": 1.1377546936273575, "epoch": 0.6198547215496368, "grad_norm": 0.15811605751514435, "learning_rate": 4.6953524759527054e-05, "loss": 1.1342792510986328, "mean_token_accuracy": 0.6696078702807426, "num_tokens": 6205888.0, "step": 64 }, { "entropy": 1.117256410419941, "epoch": 0.6295399515738499, "grad_norm": 0.14264215528964996, "learning_rate": 4.6825352829029705e-05, "loss": 1.112156629562378, "mean_token_accuracy": 0.6736717820167542, "num_tokens": 6303176.0, "step": 65 }, { "entropy": 1.1090807020664215, "epoch": 0.639225181598063, "grad_norm": 0.14527742564678192, "learning_rate": 4.6694722379811185e-05, "loss": 1.115394115447998, "mean_token_accuracy": 0.6744855791330338, "num_tokens": 6400425.0, "step": 66 }, { "entropy": 1.1179847419261932, "epoch": 0.648910411622276, "grad_norm": 0.14383482933044434, "learning_rate": 4.656164812674951e-05, "loss": 1.1273249387741089, "mean_token_accuracy": 0.6708880066871643, "num_tokens": 6497165.0, "step": 67 }, { "entropy": 1.1409042179584503, "epoch": 0.6585956416464891, "grad_norm": 0.15300460159778595, "learning_rate": 4.642614506000523e-05, "loss": 1.1354745626449585, "mean_token_accuracy": 0.6670901477336884, "num_tokens": 6594629.0, "step": 68 }, { "entropy": 1.0936977565288544, "epoch": 0.6682808716707022, "grad_norm": 0.14818546175956726, "learning_rate": 4.628822844333278e-05, "loss": 1.0947887897491455, "mean_token_accuracy": 0.6786026880145073, "num_tokens": 6691606.0, "step": 69 }, { "entropy": 1.1090299785137177, "epoch": 0.6779661016949152, "grad_norm": 0.14709310233592987, "learning_rate": 4.614791381236115e-05, "loss": 1.108567476272583, "mean_token_accuracy": 0.6737446561455727, "num_tokens": 6787144.0, "step": 70 }, { "entropy": 1.1130342036485672, "epoch": 0.6876513317191283, "grad_norm": 0.14786535501480103, "learning_rate": 4.6005216972843864e-05, "loss": 1.1175450086593628, "mean_token_accuracy": 0.6724362820386887, "num_tokens": 6884460.0, "step": 71 }, { "entropy": 1.090154156088829, "epoch": 0.6973365617433414, "grad_norm": 0.14625772833824158, "learning_rate": 4.5860153998878494e-05, "loss": 1.0817482471466064, "mean_token_accuracy": 0.67938332259655, "num_tokens": 6982209.0, "step": 72 }, { "entropy": 1.1123566552996635, "epoch": 0.7070217917675545, "grad_norm": 0.14828450977802277, "learning_rate": 4.571274123109606e-05, "loss": 1.1023019552230835, "mean_token_accuracy": 0.675434984266758, "num_tokens": 7078357.0, "step": 73 }, { "entropy": 1.1003855466842651, "epoch": 0.7167070217917676, "grad_norm": 0.14769022166728973, "learning_rate": 4.5562995274820284e-05, "loss": 1.0925781726837158, "mean_token_accuracy": 0.679414302110672, "num_tokens": 7174932.0, "step": 74 }, { "entropy": 1.066821463406086, "epoch": 0.7263922518159807, "grad_norm": 0.14872464537620544, "learning_rate": 4.541093299819714e-05, "loss": 1.0721882581710815, "mean_token_accuracy": 0.6860671788454056, "num_tokens": 7271358.0, "step": 75 }, { "entropy": 1.1028296649456024, "epoch": 0.7360774818401937, "grad_norm": 0.1491360366344452, "learning_rate": 4.5256571530294664e-05, "loss": 1.110499382019043, "mean_token_accuracy": 0.6740638688206673, "num_tokens": 7368532.0, "step": 76 }, { "entropy": 1.0569827035069466, "epoch": 0.7457627118644068, "grad_norm": 0.14861756563186646, "learning_rate": 4.5099928259173516e-05, "loss": 1.0642375946044922, "mean_token_accuracy": 0.6815041974186897, "num_tokens": 7465042.0, "step": 77 }, { "entropy": 1.0828624665737152, "epoch": 0.7554479418886199, "grad_norm": 0.15817824006080627, "learning_rate": 4.4941020829928245e-05, "loss": 1.086707353591919, "mean_token_accuracy": 0.6801510155200958, "num_tokens": 7561958.0, "step": 78 }, { "entropy": 1.0969925075769424, "epoch": 0.7651331719128329, "grad_norm": 0.1529255509376526, "learning_rate": 4.477986714269972e-05, "loss": 1.0899672508239746, "mean_token_accuracy": 0.678456224501133, "num_tokens": 7659711.0, "step": 79 }, { "entropy": 1.0624620243906975, "epoch": 0.774818401937046, "grad_norm": 0.15455132722854614, "learning_rate": 4.4616485350658685e-05, "loss": 1.0544354915618896, "mean_token_accuracy": 0.6855011060833931, "num_tokens": 7756475.0, "step": 80 }, { "entropy": 1.1112875491380692, "epoch": 0.784503631961259, "grad_norm": 0.14817237854003906, "learning_rate": 4.445089385796099e-05, "loss": 1.096229076385498, "mean_token_accuracy": 0.6748161613941193, "num_tokens": 7853572.0, "step": 81 }, { "entropy": 1.1143488436937332, "epoch": 0.7941888619854721, "grad_norm": 0.15500982105731964, "learning_rate": 4.4283111317674374e-05, "loss": 1.1159741878509521, "mean_token_accuracy": 0.6718207076191902, "num_tokens": 7951478.0, "step": 82 }, { "entropy": 1.0716768354177475, "epoch": 0.8038740920096852, "grad_norm": 0.14607810974121094, "learning_rate": 4.4113156629677316e-05, "loss": 1.0741264820098877, "mean_token_accuracy": 0.6826100572943687, "num_tokens": 8048090.0, "step": 83 }, { "entropy": 1.08623006939888, "epoch": 0.8135593220338984, "grad_norm": 0.1486004889011383, "learning_rate": 4.394104893853007e-05, "loss": 1.0830330848693848, "mean_token_accuracy": 0.678254209458828, "num_tokens": 8145495.0, "step": 84 }, { "entropy": 1.0595624893903732, "epoch": 0.8232445520581114, "grad_norm": 0.15346822142601013, "learning_rate": 4.3766807631318106e-05, "loss": 1.0648397207260132, "mean_token_accuracy": 0.6820255219936371, "num_tokens": 8243257.0, "step": 85 }, { "entropy": 1.0569987148046494, "epoch": 0.8329297820823245, "grad_norm": 0.15623626112937927, "learning_rate": 4.359045233546827e-05, "loss": 1.0685005187988281, "mean_token_accuracy": 0.684545986354351, "num_tokens": 8338257.0, "step": 86 }, { "entropy": 1.0479903519153595, "epoch": 0.8426150121065376, "grad_norm": 0.14811332523822784, "learning_rate": 4.341200291653781e-05, "loss": 1.058138132095337, "mean_token_accuracy": 0.6859943941235542, "num_tokens": 8436280.0, "step": 87 }, { "entropy": 1.1004953235387802, "epoch": 0.8523002421307506, "grad_norm": 0.1508825272321701, "learning_rate": 4.323147947597666e-05, "loss": 1.1114561557769775, "mean_token_accuracy": 0.6722725033760071, "num_tokens": 8534296.0, "step": 88 }, { "entropy": 1.0389911904931068, "epoch": 0.8619854721549637, "grad_norm": 0.1480080932378769, "learning_rate": 4.3048902348863116e-05, "loss": 1.0304014682769775, "mean_token_accuracy": 0.6923525035381317, "num_tokens": 8631835.0, "step": 89 }, { "entropy": 1.0742208510637283, "epoch": 0.8716707021791767, "grad_norm": 0.14625877141952515, "learning_rate": 4.2864292101613136e-05, "loss": 1.0725879669189453, "mean_token_accuracy": 0.6854639276862144, "num_tokens": 8728666.0, "step": 90 }, { "entropy": 1.036693975329399, "epoch": 0.8813559322033898, "grad_norm": 0.14420975744724274, "learning_rate": 4.267766952966369e-05, "loss": 1.0207698345184326, "mean_token_accuracy": 0.6963317543268204, "num_tokens": 8826157.0, "step": 91 }, { "entropy": 1.066306859254837, "epoch": 0.8910411622276029, "grad_norm": 0.154633030295372, "learning_rate": 4.248905565513023e-05, "loss": 1.0533056259155273, "mean_token_accuracy": 0.6857179254293442, "num_tokens": 8919599.0, "step": 92 }, { "entropy": 1.0462640300393105, "epoch": 0.9007263922518159, "grad_norm": 0.15113948285579681, "learning_rate": 4.229847172443866e-05, "loss": 1.0407187938690186, "mean_token_accuracy": 0.6907829195261002, "num_tokens": 9017083.0, "step": 93 }, { "entropy": 1.0615776777267456, "epoch": 0.910411622276029, "grad_norm": 0.1515236496925354, "learning_rate": 4.210593920593201e-05, "loss": 1.0574121475219727, "mean_token_accuracy": 0.6874448731541634, "num_tokens": 9114699.0, "step": 94 }, { "entropy": 1.0619953870773315, "epoch": 0.9200968523002422, "grad_norm": 0.15497922897338867, "learning_rate": 4.191147978745218e-05, "loss": 1.0640019178390503, "mean_token_accuracy": 0.6830037236213684, "num_tokens": 9212478.0, "step": 95 }, { "entropy": 1.0610519051551819, "epoch": 0.9297820823244553, "grad_norm": 0.16060221195220947, "learning_rate": 4.171511537389684e-05, "loss": 1.0584205389022827, "mean_token_accuracy": 0.6856881454586983, "num_tokens": 9309385.0, "step": 96 }, { "entropy": 1.0446307063102722, "epoch": 0.9394673123486683, "grad_norm": 0.15420550107955933, "learning_rate": 4.151686808475204e-05, "loss": 1.047270655632019, "mean_token_accuracy": 0.6872993409633636, "num_tokens": 9405674.0, "step": 97 }, { "entropy": 1.054522544145584, "epoch": 0.9491525423728814, "grad_norm": 0.15661559998989105, "learning_rate": 4.131676025160047e-05, "loss": 1.0625941753387451, "mean_token_accuracy": 0.6845473125576973, "num_tokens": 9502863.0, "step": 98 }, { "entropy": 1.0278218686580658, "epoch": 0.9588377723970944, "grad_norm": 0.15473391115665436, "learning_rate": 4.111481441560598e-05, "loss": 1.0273422002792358, "mean_token_accuracy": 0.6932465434074402, "num_tokens": 9600669.0, "step": 99 }, { "entropy": 1.041596107184887, "epoch": 0.9685230024213075, "grad_norm": 0.1449374407529831, "learning_rate": 4.091105332497439e-05, "loss": 1.0463595390319824, "mean_token_accuracy": 0.6912512555718422, "num_tokens": 9697304.0, "step": 100 }, { "entropy": 1.0684800148010254, "epoch": 0.9782082324455206, "grad_norm": 0.1515686959028244, "learning_rate": 4.070549993239106e-05, "loss": 1.0661861896514893, "mean_token_accuracy": 0.6858441829681396, "num_tokens": 9794066.0, "step": 101 }, { "entropy": 1.0518590733408928, "epoch": 0.9878934624697336, "grad_norm": 0.15803049504756927, "learning_rate": 4.049817739243532e-05, "loss": 1.037236213684082, "mean_token_accuracy": 0.689392939209938, "num_tokens": 9889545.0, "step": 102 }, { "entropy": 1.0445326566696167, "epoch": 0.9975786924939467, "grad_norm": 0.15257743000984192, "learning_rate": 4.028910905897229e-05, "loss": 1.0427336692810059, "mean_token_accuracy": 0.6887638568878174, "num_tokens": 9984866.0, "step": 103 }, { "entropy": 1.0611678957939148, "epoch": 1.0, "grad_norm": 0.2940840721130371, "learning_rate": 4.007831848252211e-05, "loss": 1.0530990362167358, "mean_token_accuracy": 0.6814314126968384, "num_tokens": 10009403.0, "step": 104 }, { "entropy": 1.0497082397341728, "epoch": 1.0096852300242132, "grad_norm": 0.1564565747976303, "learning_rate": 3.986582940760717e-05, "loss": 1.030436396598816, "mean_token_accuracy": 0.6926182061433792, "num_tokens": 10106335.0, "step": 105 }, { "entropy": 1.0123815387487411, "epoch": 1.0193704600484261, "grad_norm": 0.1642434448003769, "learning_rate": 3.965166577007733e-05, "loss": 1.0002119541168213, "mean_token_accuracy": 0.6985866278409958, "num_tokens": 10202191.0, "step": 106 }, { "entropy": 1.0041352361440659, "epoch": 1.0290556900726393, "grad_norm": 0.1648867130279541, "learning_rate": 3.94358516944137e-05, "loss": 1.0050082206726074, "mean_token_accuracy": 0.6969355717301369, "num_tokens": 10299771.0, "step": 107 }, { "entropy": 1.0074616223573685, "epoch": 1.0387409200968523, "grad_norm": 0.16517765820026398, "learning_rate": 3.9218411491011176e-05, "loss": 1.014854907989502, "mean_token_accuracy": 0.6966256648302078, "num_tokens": 10397225.0, "step": 108 }, { "entropy": 0.9936244934797287, "epoch": 1.0484261501210654, "grad_norm": 0.16205355525016785, "learning_rate": 3.899936965343989e-05, "loss": 1.0037654638290405, "mean_token_accuracy": 0.6981071457266808, "num_tokens": 10495072.0, "step": 109 }, { "entropy": 0.988917775452137, "epoch": 1.0581113801452784, "grad_norm": 0.16487880051136017, "learning_rate": 3.877875085568623e-05, "loss": 0.9998143911361694, "mean_token_accuracy": 0.6989010348916054, "num_tokens": 10593014.0, "step": 110 }, { "entropy": 1.0223135277628899, "epoch": 1.0677966101694916, "grad_norm": 0.1645587831735611, "learning_rate": 3.8556579949373384e-05, "loss": 1.023576021194458, "mean_token_accuracy": 0.692980445921421, "num_tokens": 10690703.0, "step": 111 }, { "entropy": 1.015090361237526, "epoch": 1.0774818401937045, "grad_norm": 0.15396536886692047, "learning_rate": 3.833288196096194e-05, "loss": 1.0166376829147339, "mean_token_accuracy": 0.6936796456575394, "num_tokens": 10788092.0, "step": 112 }, { "entropy": 1.0370544865727425, "epoch": 1.0871670702179177, "grad_norm": 0.159644216299057, "learning_rate": 3.8107682088930794e-05, "loss": 1.023399829864502, "mean_token_accuracy": 0.6933755651116371, "num_tokens": 10884533.0, "step": 113 }, { "entropy": 1.0179733633995056, "epoch": 1.0968523002421307, "grad_norm": 0.16513484716415405, "learning_rate": 3.7881005700938635e-05, "loss": 1.0117831230163574, "mean_token_accuracy": 0.6966173946857452, "num_tokens": 10980390.0, "step": 114 }, { "entropy": 1.0589358359575272, "epoch": 1.1065375302663438, "grad_norm": 0.16453009843826294, "learning_rate": 3.7652878330966415e-05, "loss": 1.041041612625122, "mean_token_accuracy": 0.6878631860017776, "num_tokens": 11076573.0, "step": 115 }, { "entropy": 1.0219000279903412, "epoch": 1.116222760290557, "grad_norm": 0.1623397022485733, "learning_rate": 3.742332567644107e-05, "loss": 1.0067601203918457, "mean_token_accuracy": 0.6953606754541397, "num_tokens": 11173211.0, "step": 116 }, { "entropy": 0.9765115603804588, "epoch": 1.12590799031477, "grad_norm": 0.15821851789951324, "learning_rate": 3.719237359534087e-05, "loss": 0.9680384397506714, "mean_token_accuracy": 0.7078221663832664, "num_tokens": 11269149.0, "step": 117 }, { "entropy": 1.0054796189069748, "epoch": 1.1355932203389831, "grad_norm": 0.16345135867595673, "learning_rate": 3.6960048103282566e-05, "loss": 1.0104200839996338, "mean_token_accuracy": 0.6938582733273506, "num_tokens": 11366538.0, "step": 118 }, { "entropy": 1.0051406398415565, "epoch": 1.145278450363196, "grad_norm": 0.155021533370018, "learning_rate": 3.672637537059093e-05, "loss": 1.0087268352508545, "mean_token_accuracy": 0.6973330229520798, "num_tokens": 11464379.0, "step": 119 }, { "entropy": 1.0200638100504875, "epoch": 1.1549636803874093, "grad_norm": 0.17094552516937256, "learning_rate": 3.6491381719350756e-05, "loss": 1.036880612373352, "mean_token_accuracy": 0.6878476142883301, "num_tokens": 11561148.0, "step": 120 }, { "entropy": 1.012288749217987, "epoch": 1.1646489104116222, "grad_norm": 0.16450250148773193, "learning_rate": 3.6255093620441834e-05, "loss": 1.0213954448699951, "mean_token_accuracy": 0.6948853880167007, "num_tokens": 11658242.0, "step": 121 }, { "entropy": 1.0086817741394043, "epoch": 1.1743341404358354, "grad_norm": 0.1626807153224945, "learning_rate": 3.6017537690557115e-05, "loss": 1.0057084560394287, "mean_token_accuracy": 0.6975555568933487, "num_tokens": 11754691.0, "step": 122 }, { "entropy": 0.9957757294178009, "epoch": 1.1840193704600483, "grad_norm": 0.15866564214229584, "learning_rate": 3.577874068920446e-05, "loss": 0.9769740104675293, "mean_token_accuracy": 0.7049618437886238, "num_tokens": 11851957.0, "step": 123 }, { "entropy": 1.023524522781372, "epoch": 1.1937046004842615, "grad_norm": 0.15701547265052795, "learning_rate": 3.553872951569236e-05, "loss": 1.0102542638778687, "mean_token_accuracy": 0.6948281303048134, "num_tokens": 11949158.0, "step": 124 }, { "entropy": 1.0255613550543785, "epoch": 1.2033898305084745, "grad_norm": 0.160598024725914, "learning_rate": 3.529753120609982e-05, "loss": 1.0142004489898682, "mean_token_accuracy": 0.6950482055544853, "num_tokens": 12047065.0, "step": 125 }, { "entropy": 1.0207768678665161, "epoch": 1.2130750605326877, "grad_norm": 0.1668667197227478, "learning_rate": 3.505517293023088e-05, "loss": 1.0299181938171387, "mean_token_accuracy": 0.6932333111763, "num_tokens": 12140843.0, "step": 126 }, { "entropy": 1.0096961930394173, "epoch": 1.2227602905569008, "grad_norm": 0.15583710372447968, "learning_rate": 3.481168198855409e-05, "loss": 1.0230910778045654, "mean_token_accuracy": 0.6935219466686249, "num_tokens": 12238169.0, "step": 127 }, { "entropy": 1.0121450945734978, "epoch": 1.2324455205811138, "grad_norm": 0.1601191908121109, "learning_rate": 3.456708580912725e-05, "loss": 1.0020897388458252, "mean_token_accuracy": 0.6964283734560013, "num_tokens": 12336055.0, "step": 128 }, { "entropy": 1.0203755050897598, "epoch": 1.242130750605327, "grad_norm": 0.16153757274150848, "learning_rate": 3.432141194450772e-05, "loss": 1.0235494375228882, "mean_token_accuracy": 0.6922239810228348, "num_tokens": 12433292.0, "step": 129 }, { "entropy": 0.9952817261219025, "epoch": 1.25181598062954, "grad_norm": 0.16117016971111298, "learning_rate": 3.407468806864883e-05, "loss": 0.9944422245025635, "mean_token_accuracy": 0.6995577961206436, "num_tokens": 12529632.0, "step": 130 }, { "entropy": 1.0067841857671738, "epoch": 1.261501210653753, "grad_norm": 0.15968872606754303, "learning_rate": 3.382694197378252e-05, "loss": 1.0131640434265137, "mean_token_accuracy": 0.6946265995502472, "num_tokens": 12627363.0, "step": 131 }, { "entropy": 1.0088231563568115, "epoch": 1.271186440677966, "grad_norm": 0.16917093098163605, "learning_rate": 3.357820156728867e-05, "loss": 1.0098109245300293, "mean_token_accuracy": 0.6978933215141296, "num_tokens": 12722873.0, "step": 132 }, { "entropy": 1.0022346451878548, "epoch": 1.2808716707021792, "grad_norm": 0.16208580136299133, "learning_rate": 3.332849486855144e-05, "loss": 1.0061886310577393, "mean_token_accuracy": 0.6940922066569328, "num_tokens": 12818842.0, "step": 133 }, { "entropy": 0.9971742331981659, "epoch": 1.2905569007263922, "grad_norm": 0.15936775505542755, "learning_rate": 3.307785000580313e-05, "loss": 0.9899219870567322, "mean_token_accuracy": 0.7014091834425926, "num_tokens": 12916424.0, "step": 134 }, { "entropy": 0.9976816847920418, "epoch": 1.3002421307506054, "grad_norm": 0.2688247561454773, "learning_rate": 3.282629521295556e-05, "loss": 1.000976324081421, "mean_token_accuracy": 0.6989069283008575, "num_tokens": 13012418.0, "step": 135 }, { "entropy": 0.9814217463135719, "epoch": 1.3099273607748185, "grad_norm": 0.1612652987241745, "learning_rate": 3.257385882641971e-05, "loss": 0.9776369333267212, "mean_token_accuracy": 0.7035728245973587, "num_tokens": 13109173.0, "step": 136 }, { "entropy": 1.001495622098446, "epoch": 1.3196125907990315, "grad_norm": 0.15470746159553528, "learning_rate": 3.232056928191376e-05, "loss": 0.9890879988670349, "mean_token_accuracy": 0.6988591179251671, "num_tokens": 13207226.0, "step": 137 }, { "entropy": 0.9967611879110336, "epoch": 1.3292978208232444, "grad_norm": 0.1591372787952423, "learning_rate": 3.2066455111259945e-05, "loss": 0.9965915679931641, "mean_token_accuracy": 0.6986541524529457, "num_tokens": 13304690.0, "step": 138 }, { "entropy": 0.9881946295499802, "epoch": 1.3389830508474576, "grad_norm": 0.16304631531238556, "learning_rate": 3.1811544939170575e-05, "loss": 0.9952649474143982, "mean_token_accuracy": 0.6945862323045731, "num_tokens": 13402318.0, "step": 139 }, { "entropy": 0.9948993697762489, "epoch": 1.3486682808716708, "grad_norm": 0.162835955619812, "learning_rate": 3.155586748002362e-05, "loss": 1.0011897087097168, "mean_token_accuracy": 0.6979707032442093, "num_tokens": 13498911.0, "step": 140 }, { "entropy": 1.0100372210144997, "epoch": 1.3583535108958837, "grad_norm": 0.1653631329536438, "learning_rate": 3.1299451534628135e-05, "loss": 1.0079827308654785, "mean_token_accuracy": 0.6955159679055214, "num_tokens": 13596489.0, "step": 141 }, { "entropy": 1.0005303993821144, "epoch": 1.368038740920097, "grad_norm": 0.15816530585289001, "learning_rate": 3.1042325986980064e-05, "loss": 0.9934114813804626, "mean_token_accuracy": 0.6982027143239975, "num_tokens": 13693181.0, "step": 142 }, { "entropy": 1.0108712911605835, "epoch": 1.3777239709443099, "grad_norm": 0.16801035404205322, "learning_rate": 3.0784519801008546e-05, "loss": 1.0035772323608398, "mean_token_accuracy": 0.6946400851011276, "num_tokens": 13790207.0, "step": 143 }, { "entropy": 0.9940394014120102, "epoch": 1.387409200968523, "grad_norm": 0.16538861393928528, "learning_rate": 3.0526062017313254e-05, "loss": 0.9854618906974792, "mean_token_accuracy": 0.6998060122132301, "num_tokens": 13886824.0, "step": 144 }, { "entropy": 1.015800602734089, "epoch": 1.397094430992736, "grad_norm": 0.16404059529304504, "learning_rate": 3.0266981749893157e-05, "loss": 1.010426640510559, "mean_token_accuracy": 0.6951465085148811, "num_tokens": 13984711.0, "step": 145 }, { "entropy": 1.0125101953744888, "epoch": 1.4067796610169492, "grad_norm": 0.1646854728460312, "learning_rate": 3.0007308182866985e-05, "loss": 1.0053914785385132, "mean_token_accuracy": 0.693408191204071, "num_tokens": 14082491.0, "step": 146 }, { "entropy": 1.0149571672081947, "epoch": 1.4164648910411621, "grad_norm": 0.27195093035697937, "learning_rate": 2.974707056718571e-05, "loss": 1.0218114852905273, "mean_token_accuracy": 0.6915486976504326, "num_tokens": 14178367.0, "step": 147 }, { "entropy": 1.0098140239715576, "epoch": 1.4261501210653753, "grad_norm": 0.16734321415424347, "learning_rate": 2.9486298217337637e-05, "loss": 1.0243513584136963, "mean_token_accuracy": 0.6904255822300911, "num_tokens": 14275669.0, "step": 148 }, { "entropy": 0.9736747220158577, "epoch": 1.4358353510895885, "grad_norm": 0.1625024378299713, "learning_rate": 2.9225020508046232e-05, "loss": 0.9738012552261353, "mean_token_accuracy": 0.7017730921506882, "num_tokens": 14372400.0, "step": 149 }, { "entropy": 1.016117848455906, "epoch": 1.4455205811138014, "grad_norm": 0.16163532435894012, "learning_rate": 2.8963266870961226e-05, "loss": 1.0025385618209839, "mean_token_accuracy": 0.6962382420897484, "num_tokens": 14468895.0, "step": 150 }, { "entropy": 1.000129446387291, "epoch": 1.4552058111380144, "grad_norm": 0.1636207103729248, "learning_rate": 2.8701066791343288e-05, "loss": 0.9981441497802734, "mean_token_accuracy": 0.6979088559746742, "num_tokens": 14566496.0, "step": 151 }, { "entropy": 1.0115438923239708, "epoch": 1.4648910411622276, "grad_norm": 0.16182203590869904, "learning_rate": 2.8438449804742628e-05, "loss": 1.0085995197296143, "mean_token_accuracy": 0.6946075111627579, "num_tokens": 14664097.0, "step": 152 }, { "entropy": 0.9745980277657509, "epoch": 1.4745762711864407, "grad_norm": 0.1606246829032898, "learning_rate": 2.8175445493671972e-05, "loss": 0.9741977453231812, "mean_token_accuracy": 0.7038497105240822, "num_tokens": 14761778.0, "step": 153 }, { "entropy": 0.9997073635458946, "epoch": 1.4842615012106537, "grad_norm": 0.1606900691986084, "learning_rate": 2.7912083484274266e-05, "loss": 1.0080050230026245, "mean_token_accuracy": 0.6961813271045685, "num_tokens": 14858797.0, "step": 154 }, { "entropy": 1.014495812356472, "epoch": 1.4939467312348669, "grad_norm": 0.16178575158119202, "learning_rate": 2.7648393442985403e-05, "loss": 1.0042692422866821, "mean_token_accuracy": 0.69585070759058, "num_tokens": 14955777.0, "step": 155 }, { "entropy": 1.0302998945116997, "epoch": 1.5036319612590798, "grad_norm": 0.16053006052970886, "learning_rate": 2.7384405073192454e-05, "loss": 1.0217926502227783, "mean_token_accuracy": 0.6916443780064583, "num_tokens": 15052841.0, "step": 156 }, { "entropy": 0.9914230555295944, "epoch": 1.513317191283293, "grad_norm": 0.15790845453739166, "learning_rate": 2.7120148111887732e-05, "loss": 0.9867815971374512, "mean_token_accuracy": 0.7012891918420792, "num_tokens": 15146917.0, "step": 157 }, { "entropy": 0.9733176603913307, "epoch": 1.5230024213075062, "grad_norm": 0.15671640634536743, "learning_rate": 2.6855652326319063e-05, "loss": 0.9663571715354919, "mean_token_accuracy": 0.7067279890179634, "num_tokens": 15244027.0, "step": 158 }, { "entropy": 0.9909517616033554, "epoch": 1.5326876513317191, "grad_norm": 0.15879209339618683, "learning_rate": 2.659094751063666e-05, "loss": 0.9971685409545898, "mean_token_accuracy": 0.6988729164004326, "num_tokens": 15340804.0, "step": 159 }, { "entropy": 1.0000923573970795, "epoch": 1.542372881355932, "grad_norm": 0.15917372703552246, "learning_rate": 2.6326063482536934e-05, "loss": 1.0012197494506836, "mean_token_accuracy": 0.6966550797224045, "num_tokens": 15437706.0, "step": 160 }, { "entropy": 1.0145022571086884, "epoch": 1.5520581113801453, "grad_norm": 0.16265787184238434, "learning_rate": 2.606103007990371e-05, "loss": 1.0111325979232788, "mean_token_accuracy": 0.6933945044875145, "num_tokens": 15531879.0, "step": 161 }, { "entropy": 1.0036377906799316, "epoch": 1.5617433414043584, "grad_norm": 0.16375237703323364, "learning_rate": 2.579587715744712e-05, "loss": 1.0029797554016113, "mean_token_accuracy": 0.6955940127372742, "num_tokens": 15629721.0, "step": 162 }, { "entropy": 1.0386734753847122, "epoch": 1.5714285714285714, "grad_norm": 0.16306881606578827, "learning_rate": 2.5530634583340592e-05, "loss": 1.0406312942504883, "mean_token_accuracy": 0.6886710077524185, "num_tokens": 15727030.0, "step": 163 }, { "entropy": 0.9940996393561363, "epoch": 1.5811138014527844, "grad_norm": 0.16509971022605896, "learning_rate": 2.526533223585641e-05, "loss": 0.9921597838401794, "mean_token_accuracy": 0.7000836208462715, "num_tokens": 15823642.0, "step": 164 }, { "entropy": 1.0113196671009064, "epoch": 1.5907990314769975, "grad_norm": 0.17014694213867188, "learning_rate": 2.5e-05, "loss": 1.000211238861084, "mean_token_accuracy": 0.696845568716526, "num_tokens": 15920894.0, "step": 165 }, { "entropy": 1.0079443007707596, "epoch": 1.6004842615012107, "grad_norm": 0.16094236075878143, "learning_rate": 2.47346677641436e-05, "loss": 0.9985548257827759, "mean_token_accuracy": 0.6970102190971375, "num_tokens": 16018678.0, "step": 166 }, { "entropy": 1.0026478096842766, "epoch": 1.6101694915254239, "grad_norm": 0.16517619788646698, "learning_rate": 2.446936541665941e-05, "loss": 0.9906925559043884, "mean_token_accuracy": 0.6991379931569099, "num_tokens": 16115100.0, "step": 167 }, { "entropy": 1.009756289422512, "epoch": 1.6198547215496368, "grad_norm": 0.16483961045742035, "learning_rate": 2.4204122842552896e-05, "loss": 1.0100080966949463, "mean_token_accuracy": 0.6920091360807419, "num_tokens": 16212185.0, "step": 168 }, { "entropy": 0.9892624393105507, "epoch": 1.6295399515738498, "grad_norm": 0.16626964509487152, "learning_rate": 2.39389699200963e-05, "loss": 0.9917020797729492, "mean_token_accuracy": 0.6994179859757423, "num_tokens": 16309607.0, "step": 169 }, { "entropy": 0.9693093672394753, "epoch": 1.639225181598063, "grad_norm": 0.16250012814998627, "learning_rate": 2.3673936517463075e-05, "loss": 0.9778143763542175, "mean_token_accuracy": 0.7030152902007103, "num_tokens": 16403478.0, "step": 170 }, { "entropy": 0.999257817864418, "epoch": 1.6489104116222761, "grad_norm": 0.16267414391040802, "learning_rate": 2.3409052489363342e-05, "loss": 1.008827805519104, "mean_token_accuracy": 0.6968575343489647, "num_tokens": 16499376.0, "step": 171 }, { "entropy": 0.9948962330818176, "epoch": 1.658595641646489, "grad_norm": 0.16714368760585785, "learning_rate": 2.3144347673680936e-05, "loss": 1.0074965953826904, "mean_token_accuracy": 0.694792777299881, "num_tokens": 16597152.0, "step": 172 }, { "entropy": 0.9955190569162369, "epoch": 1.668280871670702, "grad_norm": 0.17781881988048553, "learning_rate": 2.287985188811228e-05, "loss": 0.9991034269332886, "mean_token_accuracy": 0.697237454354763, "num_tokens": 16693593.0, "step": 173 }, { "entropy": 0.9868601709604263, "epoch": 1.6779661016949152, "grad_norm": 0.1637657880783081, "learning_rate": 2.261559492680755e-05, "loss": 0.9883804321289062, "mean_token_accuracy": 0.7004631012678146, "num_tokens": 16791648.0, "step": 174 }, { "entropy": 0.9998594745993614, "epoch": 1.6876513317191284, "grad_norm": 0.16492129862308502, "learning_rate": 2.23516065570146e-05, "loss": 0.988003134727478, "mean_token_accuracy": 0.7004012763500214, "num_tokens": 16887565.0, "step": 175 }, { "entropy": 0.9922599494457245, "epoch": 1.6973365617433414, "grad_norm": 0.16476185619831085, "learning_rate": 2.2087916515725737e-05, "loss": 0.9830120801925659, "mean_token_accuracy": 0.7036381214857101, "num_tokens": 16983866.0, "step": 176 }, { "entropy": 0.9667748808860779, "epoch": 1.7070217917675545, "grad_norm": 0.1622721403837204, "learning_rate": 2.182455450632803e-05, "loss": 0.9589613676071167, "mean_token_accuracy": 0.7059106230735779, "num_tokens": 17080511.0, "step": 177 }, { "entropy": 1.0044486820697784, "epoch": 1.7167070217917675, "grad_norm": 0.16303181648254395, "learning_rate": 2.1561550195257378e-05, "loss": 1.0007452964782715, "mean_token_accuracy": 0.6962373182177544, "num_tokens": 17177327.0, "step": 178 }, { "entropy": 0.9671204686164856, "epoch": 1.7263922518159807, "grad_norm": 0.16110743582248688, "learning_rate": 2.1298933208656718e-05, "loss": 0.9604004621505737, "mean_token_accuracy": 0.7054437473416328, "num_tokens": 17272025.0, "step": 179 }, { "entropy": 0.9986064434051514, "epoch": 1.7360774818401938, "grad_norm": 0.17059385776519775, "learning_rate": 2.103673312903878e-05, "loss": 1.0034087896347046, "mean_token_accuracy": 0.695854052901268, "num_tokens": 17369047.0, "step": 180 }, { "entropy": 1.0043450593948364, "epoch": 1.7457627118644068, "grad_norm": 0.16405996680259705, "learning_rate": 2.0774979491953777e-05, "loss": 1.004425048828125, "mean_token_accuracy": 0.6962170526385307, "num_tokens": 17466402.0, "step": 181 }, { "entropy": 0.9758473634719849, "epoch": 1.7554479418886197, "grad_norm": 0.1624099463224411, "learning_rate": 2.0513701782662366e-05, "loss": 0.9758256673812866, "mean_token_accuracy": 0.702741451561451, "num_tokens": 17563946.0, "step": 182 }, { "entropy": 0.9875493124127388, "epoch": 1.765133171912833, "grad_norm": 0.16150467097759247, "learning_rate": 2.025292943281429e-05, "loss": 0.9866945743560791, "mean_token_accuracy": 0.7015281021595001, "num_tokens": 17661994.0, "step": 183 }, { "entropy": 0.9763547852635384, "epoch": 1.774818401937046, "grad_norm": 0.16172127425670624, "learning_rate": 1.9992691817133024e-05, "loss": 0.9720677733421326, "mean_token_accuracy": 0.7051981464028358, "num_tokens": 17759062.0, "step": 184 }, { "entropy": 0.9876666143536568, "epoch": 1.784503631961259, "grad_norm": 0.1627873331308365, "learning_rate": 1.973301825010685e-05, "loss": 0.9883197546005249, "mean_token_accuracy": 0.7009499967098236, "num_tokens": 17857030.0, "step": 185 }, { "entropy": 0.9885219484567642, "epoch": 1.794188861985472, "grad_norm": 0.16328956186771393, "learning_rate": 1.947393798268676e-05, "loss": 0.9787638187408447, "mean_token_accuracy": 0.7017620652914047, "num_tokens": 17954718.0, "step": 186 }, { "entropy": 0.9936325624585152, "epoch": 1.8038740920096852, "grad_norm": 0.16579745709896088, "learning_rate": 1.9215480198991466e-05, "loss": 0.9860278964042664, "mean_token_accuracy": 0.7013640478253365, "num_tokens": 18052307.0, "step": 187 }, { "entropy": 0.9761279001832008, "epoch": 1.8135593220338984, "grad_norm": 0.16758285462856293, "learning_rate": 1.895767401301994e-05, "loss": 0.9741207361221313, "mean_token_accuracy": 0.7015948817133904, "num_tokens": 18149449.0, "step": 188 }, { "entropy": 0.9821500703692436, "epoch": 1.8232445520581115, "grad_norm": 0.15871122479438782, "learning_rate": 1.8700548465371874e-05, "loss": 0.9747895002365112, "mean_token_accuracy": 0.7048889771103859, "num_tokens": 18247120.0, "step": 189 }, { "entropy": 1.0027316063642502, "epoch": 1.8329297820823245, "grad_norm": 0.1635945439338684, "learning_rate": 1.84441325199764e-05, "loss": 1.0001788139343262, "mean_token_accuracy": 0.696582555770874, "num_tokens": 18344157.0, "step": 190 }, { "entropy": 0.9462392926216125, "epoch": 1.8426150121065374, "grad_norm": 0.1615677773952484, "learning_rate": 1.818845506082943e-05, "loss": 0.9510740637779236, "mean_token_accuracy": 0.70773646235466, "num_tokens": 18441268.0, "step": 191 }, { "entropy": 1.0037222057580948, "epoch": 1.8523002421307506, "grad_norm": 0.16842308640480042, "learning_rate": 1.793354488874006e-05, "loss": 1.0088788270950317, "mean_token_accuracy": 0.6934759691357613, "num_tokens": 18537788.0, "step": 192 }, { "entropy": 0.9667429774999619, "epoch": 1.8619854721549638, "grad_norm": 0.16219115257263184, "learning_rate": 1.7679430718086243e-05, "loss": 0.969014585018158, "mean_token_accuracy": 0.7043875381350517, "num_tokens": 18634210.0, "step": 193 }, { "entropy": 0.9850651919841766, "epoch": 1.8716707021791767, "grad_norm": 0.16740399599075317, "learning_rate": 1.742614117358029e-05, "loss": 0.9887316226959229, "mean_token_accuracy": 0.6999648213386536, "num_tokens": 18730773.0, "step": 194 }, { "entropy": 0.9965796321630478, "epoch": 1.8813559322033897, "grad_norm": 0.1601548194885254, "learning_rate": 1.7173704787044446e-05, "loss": 1.0006155967712402, "mean_token_accuracy": 0.6969467177987099, "num_tokens": 18828751.0, "step": 195 }, { "entropy": 0.9734840467572212, "epoch": 1.8910411622276029, "grad_norm": 0.16879691183567047, "learning_rate": 1.6922149994196878e-05, "loss": 0.9744443297386169, "mean_token_accuracy": 0.7044009938836098, "num_tokens": 18924854.0, "step": 196 }, { "entropy": 0.9900180175900459, "epoch": 1.900726392251816, "grad_norm": 0.16602978110313416, "learning_rate": 1.667150513144856e-05, "loss": 0.9910145998001099, "mean_token_accuracy": 0.6993976980447769, "num_tokens": 19022636.0, "step": 197 }, { "entropy": 1.0208289474248886, "epoch": 1.910411622276029, "grad_norm": 0.16639183461666107, "learning_rate": 1.6421798432711345e-05, "loss": 1.0081907510757446, "mean_token_accuracy": 0.6937614306807518, "num_tokens": 19119897.0, "step": 198 }, { "entropy": 1.0175106599926949, "epoch": 1.9200968523002422, "grad_norm": 0.16621938347816467, "learning_rate": 1.617305802621748e-05, "loss": 1.0121101140975952, "mean_token_accuracy": 0.6952445805072784, "num_tokens": 19216975.0, "step": 199 }, { "entropy": 0.993683896958828, "epoch": 1.9297820823244551, "grad_norm": 0.16414102911949158, "learning_rate": 1.5925311931351172e-05, "loss": 0.9927324056625366, "mean_token_accuracy": 0.7005998194217682, "num_tokens": 19314144.0, "step": 200 }, { "entropy": 0.9706481248140335, "epoch": 1.9394673123486683, "grad_norm": 0.16486144065856934, "learning_rate": 1.567858805549229e-05, "loss": 0.9645916819572449, "mean_token_accuracy": 0.7075545489788055, "num_tokens": 19411168.0, "step": 201 }, { "entropy": 0.9547639638185501, "epoch": 1.9491525423728815, "grad_norm": 0.16740481555461884, "learning_rate": 1.5432914190872757e-05, "loss": 0.9521715044975281, "mean_token_accuracy": 0.7096640020608902, "num_tokens": 19508050.0, "step": 202 }, { "entropy": 0.9757836386561394, "epoch": 1.9588377723970944, "grad_norm": 0.16067975759506226, "learning_rate": 1.5188318011445906e-05, "loss": 0.976540207862854, "mean_token_accuracy": 0.7041280418634415, "num_tokens": 19604931.0, "step": 203 }, { "entropy": 0.960599772632122, "epoch": 1.9685230024213074, "grad_norm": 0.16080203652381897, "learning_rate": 1.4944827069769123e-05, "loss": 0.9553600549697876, "mean_token_accuracy": 0.7085657268762589, "num_tokens": 19700943.0, "step": 204 }, { "entropy": 0.9594792500138283, "epoch": 1.9782082324455206, "grad_norm": 0.1573885977268219, "learning_rate": 1.4702468793900188e-05, "loss": 0.9603473544120789, "mean_token_accuracy": 0.7059226110577583, "num_tokens": 19798974.0, "step": 205 }, { "entropy": 0.9801315888762474, "epoch": 1.9878934624697338, "grad_norm": 0.16511794924736023, "learning_rate": 1.4461270484307643e-05, "loss": 0.9834091663360596, "mean_token_accuracy": 0.7020789682865143, "num_tokens": 19896619.0, "step": 206 }, { "entropy": 1.0063806548714638, "epoch": 1.9975786924939467, "grad_norm": 0.16854998469352722, "learning_rate": 1.4221259310795543e-05, "loss": 1.0062599182128906, "mean_token_accuracy": 0.6940593868494034, "num_tokens": 19994525.0, "step": 207 }, { "entropy": 1.0087562799453735, "epoch": 2.0, "grad_norm": 0.32751402258872986, "learning_rate": 1.3982462309442889e-05, "loss": 1.0107228755950928, "mean_token_accuracy": 0.6938549876213074, "num_tokens": 20018806.0, "step": 208 } ], "logging_steps": 1, "max_steps": 312, "num_input_tokens_seen": 0, "num_train_epochs": 3, "save_steps": 500, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 2.8948254401683784e+18, "train_batch_size": 1, "trial_name": null, "trial_params": null }