{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 2.0, "eval_steps": 500, "global_step": 158, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "entropy": 1.3162457048892975, "epoch": 0.0128, "grad_norm": 1.352159857749939, "learning_rate": 0.0, "loss": 2.1207475662231445, "mean_token_accuracy": 0.519522450864315, "num_tokens": 128267.0, "step": 1 }, { "entropy": 1.3375049829483032, "epoch": 0.0256, "grad_norm": 1.3233879804611206, "learning_rate": 4.166666666666667e-06, "loss": 2.1054062843322754, "mean_token_accuracy": 0.5206284299492836, "num_tokens": 253824.0, "step": 2 }, { "entropy": 1.4048671871423721, "epoch": 0.0384, "grad_norm": 1.2062019109725952, "learning_rate": 8.333333333333334e-06, "loss": 2.087756633758545, "mean_token_accuracy": 0.5199320912361145, "num_tokens": 382699.0, "step": 3 }, { "entropy": 1.5049891620874405, "epoch": 0.0512, "grad_norm": 0.9262659549713135, "learning_rate": 1.25e-05, "loss": 1.995165467262268, "mean_token_accuracy": 0.5279128178954124, "num_tokens": 511796.0, "step": 4 }, { "entropy": 1.6395027190446854, "epoch": 0.064, "grad_norm": 0.6157782673835754, "learning_rate": 1.6666666666666667e-05, "loss": 1.902457594871521, "mean_token_accuracy": 0.5378688499331474, "num_tokens": 639293.0, "step": 5 }, { "entropy": 1.7712273597717285, "epoch": 0.0768, "grad_norm": 0.41292306780815125, "learning_rate": 2.0833333333333336e-05, "loss": 1.814640998840332, "mean_token_accuracy": 0.551142543554306, "num_tokens": 768431.0, "step": 6 }, { "entropy": 1.9540852010250092, "epoch": 0.0896, "grad_norm": 0.501342236995697, "learning_rate": 2.5e-05, "loss": 1.7964210510253906, "mean_token_accuracy": 0.5524477660655975, "num_tokens": 896030.0, "step": 7 }, { "entropy": 2.001556009054184, "epoch": 0.1024, "grad_norm": 0.5916482210159302, "learning_rate": 2.916666666666667e-05, "loss": 1.74098801612854, "mean_token_accuracy": 0.5590195059776306, "num_tokens": 1024099.0, "step": 8 }, { "entropy": 1.8932171761989594, "epoch": 0.1152, "grad_norm": 0.5141144394874573, "learning_rate": 3.3333333333333335e-05, "loss": 1.6654725074768066, "mean_token_accuracy": 0.5705089494585991, "num_tokens": 1151261.0, "step": 9 }, { "entropy": 1.7713737785816193, "epoch": 0.128, "grad_norm": 0.38611456751823425, "learning_rate": 3.7500000000000003e-05, "loss": 1.6301219463348389, "mean_token_accuracy": 0.5723346620798111, "num_tokens": 1280169.0, "step": 10 }, { "entropy": 1.5953099429607391, "epoch": 0.1408, "grad_norm": 0.3014231324195862, "learning_rate": 4.166666666666667e-05, "loss": 1.563348412513733, "mean_token_accuracy": 0.5855296552181244, "num_tokens": 1408663.0, "step": 11 }, { "entropy": 1.498468354344368, "epoch": 0.1536, "grad_norm": 0.29069405794143677, "learning_rate": 4.5833333333333334e-05, "loss": 1.5376625061035156, "mean_token_accuracy": 0.5896067395806313, "num_tokens": 1537364.0, "step": 12 }, { "entropy": 1.4390365332365036, "epoch": 0.1664, "grad_norm": 0.2850739359855652, "learning_rate": 5e-05, "loss": 1.5183324813842773, "mean_token_accuracy": 0.5939378440380096, "num_tokens": 1665784.0, "step": 13 }, { "entropy": 1.3894367814064026, "epoch": 0.1792, "grad_norm": 0.254903644323349, "learning_rate": 4.999756310023261e-05, "loss": 1.4691948890686035, "mean_token_accuracy": 0.6029341071844101, "num_tokens": 1793645.0, "step": 14 }, { "entropy": 1.3888143301010132, "epoch": 0.192, "grad_norm": 0.2366946041584015, "learning_rate": 4.999025287600886e-05, "loss": 1.437840461730957, "mean_token_accuracy": 0.6058616042137146, "num_tokens": 1923235.0, "step": 15 }, { "entropy": 1.38721963763237, "epoch": 0.2048, "grad_norm": 0.24185693264007568, "learning_rate": 4.997807075247146e-05, "loss": 1.388806939125061, "mean_token_accuracy": 0.6189781129360199, "num_tokens": 2047392.0, "step": 16 }, { "entropy": 1.411361888051033, "epoch": 0.2176, "grad_norm": 0.2459052950143814, "learning_rate": 4.996101910454953e-05, "loss": 1.3761913776397705, "mean_token_accuracy": 0.6179594621062279, "num_tokens": 2176102.0, "step": 17 }, { "entropy": 1.4147253632545471, "epoch": 0.2304, "grad_norm": 0.19693808257579803, "learning_rate": 4.993910125649561e-05, "loss": 1.3652762174606323, "mean_token_accuracy": 0.621271513402462, "num_tokens": 2306210.0, "step": 18 }, { "entropy": 1.3803435266017914, "epoch": 0.2432, "grad_norm": 0.19281397759914398, "learning_rate": 4.991232148123761e-05, "loss": 1.3464841842651367, "mean_token_accuracy": 0.6208974272012711, "num_tokens": 2435600.0, "step": 19 }, { "entropy": 1.35707126557827, "epoch": 0.256, "grad_norm": 0.18975713849067688, "learning_rate": 4.988068499954578e-05, "loss": 1.3281123638153076, "mean_token_accuracy": 0.6283634603023529, "num_tokens": 2563297.0, "step": 20 }, { "entropy": 1.3186347782611847, "epoch": 0.2688, "grad_norm": 0.18689435720443726, "learning_rate": 4.984419797901491e-05, "loss": 1.2913005352020264, "mean_token_accuracy": 0.6341830417513847, "num_tokens": 2693321.0, "step": 21 }, { "entropy": 1.2915433645248413, "epoch": 0.2816, "grad_norm": 0.16926461458206177, "learning_rate": 4.980286753286195e-05, "loss": 1.2752561569213867, "mean_token_accuracy": 0.6396686807274818, "num_tokens": 2822308.0, "step": 22 }, { "entropy": 1.3217644691467285, "epoch": 0.2944, "grad_norm": 0.17539748549461365, "learning_rate": 4.975670171853926e-05, "loss": 1.2967042922973633, "mean_token_accuracy": 0.6322600916028023, "num_tokens": 2948321.0, "step": 23 }, { "entropy": 1.305735170841217, "epoch": 0.3072, "grad_norm": 0.18748317658901215, "learning_rate": 4.9705709536163824e-05, "loss": 1.2801027297973633, "mean_token_accuracy": 0.6383148655295372, "num_tokens": 3075824.0, "step": 24 }, { "entropy": 1.2684594690799713, "epoch": 0.32, "grad_norm": 0.17818772792816162, "learning_rate": 4.964990092676263e-05, "loss": 1.2617098093032837, "mean_token_accuracy": 0.6398709714412689, "num_tokens": 3204534.0, "step": 25 }, { "entropy": 1.2367210537195206, "epoch": 0.3328, "grad_norm": 0.15789498388767242, "learning_rate": 4.9589286770334654e-05, "loss": 1.237747073173523, "mean_token_accuracy": 0.6457515805959702, "num_tokens": 3332525.0, "step": 26 }, { "entropy": 1.26371830701828, "epoch": 0.3456, "grad_norm": 0.15905392169952393, "learning_rate": 4.952387888372979e-05, "loss": 1.2668375968933105, "mean_token_accuracy": 0.6412620171904564, "num_tokens": 3461036.0, "step": 27 }, { "entropy": 1.2327947914600372, "epoch": 0.3584, "grad_norm": 0.1592377871274948, "learning_rate": 4.9453690018345144e-05, "loss": 1.234164834022522, "mean_token_accuracy": 0.6465037614107132, "num_tokens": 3589380.0, "step": 28 }, { "entropy": 1.225911945104599, "epoch": 0.3712, "grad_norm": 0.16118580102920532, "learning_rate": 4.937873385763908e-05, "loss": 1.2210657596588135, "mean_token_accuracy": 0.648338608443737, "num_tokens": 3717664.0, "step": 29 }, { "entropy": 1.2561272978782654, "epoch": 0.384, "grad_norm": 0.1599515676498413, "learning_rate": 4.929902501446366e-05, "loss": 1.2360204458236694, "mean_token_accuracy": 0.6447968706488609, "num_tokens": 3844833.0, "step": 30 }, { "entropy": 1.239769622683525, "epoch": 0.3968, "grad_norm": 0.15974652767181396, "learning_rate": 4.9214579028215776e-05, "loss": 1.2166938781738281, "mean_token_accuracy": 0.6490442007780075, "num_tokens": 3974478.0, "step": 31 }, { "entropy": 1.239488497376442, "epoch": 0.4096, "grad_norm": 0.1755683869123459, "learning_rate": 4.912541236180779e-05, "loss": 1.2133210897445679, "mean_token_accuracy": 0.651265911757946, "num_tokens": 4104263.0, "step": 32 }, { "entropy": 1.223443627357483, "epoch": 0.4224, "grad_norm": 0.15209320187568665, "learning_rate": 4.9031542398457974e-05, "loss": 1.202136754989624, "mean_token_accuracy": 0.6539920642971992, "num_tokens": 4233892.0, "step": 33 }, { "entropy": 1.2144603580236435, "epoch": 0.4352, "grad_norm": 0.1438663750886917, "learning_rate": 4.893298743830168e-05, "loss": 1.2046866416931152, "mean_token_accuracy": 0.6516713947057724, "num_tokens": 4362313.0, "step": 34 }, { "entropy": 1.2047844678163528, "epoch": 0.448, "grad_norm": 0.14309684932231903, "learning_rate": 4.882976669482367e-05, "loss": 1.1985797882080078, "mean_token_accuracy": 0.6538008749485016, "num_tokens": 4490686.0, "step": 35 }, { "entropy": 1.155385822057724, "epoch": 0.4608, "grad_norm": 0.1452430784702301, "learning_rate": 4.8721900291112415e-05, "loss": 1.1461997032165527, "mean_token_accuracy": 0.6639315262436867, "num_tokens": 4618481.0, "step": 36 }, { "entropy": 1.1931456923484802, "epoch": 0.4736, "grad_norm": 0.14111614227294922, "learning_rate": 4.860940925593703e-05, "loss": 1.1837263107299805, "mean_token_accuracy": 0.6538461446762085, "num_tokens": 4746449.0, "step": 37 }, { "entropy": 1.2137931138277054, "epoch": 0.4864, "grad_norm": 0.1422092169523239, "learning_rate": 4.849231551964771e-05, "loss": 1.1992123126983643, "mean_token_accuracy": 0.6522813364863396, "num_tokens": 4875695.0, "step": 38 }, { "entropy": 1.1690412908792496, "epoch": 0.4992, "grad_norm": 0.14533959329128265, "learning_rate": 4.837064190990036e-05, "loss": 1.1562764644622803, "mean_token_accuracy": 0.6618529111146927, "num_tokens": 5002824.0, "step": 39 }, { "entropy": 1.163830503821373, "epoch": 0.512, "grad_norm": 0.14272262156009674, "learning_rate": 4.8244412147206284e-05, "loss": 1.1516133546829224, "mean_token_accuracy": 0.6619244366884232, "num_tokens": 5132045.0, "step": 40 }, { "entropy": 1.148694396018982, "epoch": 0.5248, "grad_norm": 0.13471876084804535, "learning_rate": 4.8113650840307834e-05, "loss": 1.1472002267837524, "mean_token_accuracy": 0.6657932102680206, "num_tokens": 5261038.0, "step": 41 }, { "entropy": 1.1257383078336716, "epoch": 0.5376, "grad_norm": 0.1379338800907135, "learning_rate": 4.797838348138086e-05, "loss": 1.1339021921157837, "mean_token_accuracy": 0.6660185307264328, "num_tokens": 5388912.0, "step": 42 }, { "entropy": 1.1311924755573273, "epoch": 0.5504, "grad_norm": 0.14049763977527618, "learning_rate": 4.783863644106502e-05, "loss": 1.135345697402954, "mean_token_accuracy": 0.6648508384823799, "num_tokens": 5518618.0, "step": 43 }, { "entropy": 1.1455007046461105, "epoch": 0.5632, "grad_norm": 0.13285057246685028, "learning_rate": 4.769443696332272e-05, "loss": 1.1532269716262817, "mean_token_accuracy": 0.6633262932300568, "num_tokens": 5648116.0, "step": 44 }, { "entropy": 1.1428617984056473, "epoch": 0.576, "grad_norm": 0.13333706557750702, "learning_rate": 4.754581316012785e-05, "loss": 1.1316198110580444, "mean_token_accuracy": 0.668374814093113, "num_tokens": 5777117.0, "step": 45 }, { "entropy": 1.1585663259029388, "epoch": 0.5888, "grad_norm": 0.14425642788410187, "learning_rate": 4.7392794005985326e-05, "loss": 1.1365997791290283, "mean_token_accuracy": 0.6671516969799995, "num_tokens": 5904876.0, "step": 46 }, { "entropy": 1.150609478354454, "epoch": 0.6016, "grad_norm": 0.15504664182662964, "learning_rate": 4.723540933228244e-05, "loss": 1.127173662185669, "mean_token_accuracy": 0.6687930002808571, "num_tokens": 6034768.0, "step": 47 }, { "entropy": 1.1596223711967468, "epoch": 0.6144, "grad_norm": 0.12928146123886108, "learning_rate": 4.707368982147318e-05, "loss": 1.1445682048797607, "mean_token_accuracy": 0.6648146286606789, "num_tokens": 6163126.0, "step": 48 }, { "entropy": 1.0994263589382172, "epoch": 0.6272, "grad_norm": 0.1349116712808609, "learning_rate": 4.690766700109659e-05, "loss": 1.0948941707611084, "mean_token_accuracy": 0.6754020154476166, "num_tokens": 6291570.0, "step": 49 }, { "entropy": 1.112744465470314, "epoch": 0.64, "grad_norm": 0.14497768878936768, "learning_rate": 4.6737373237630476e-05, "loss": 1.1113452911376953, "mean_token_accuracy": 0.6713321506977081, "num_tokens": 6420084.0, "step": 50 }, { "entropy": 1.1346999406814575, "epoch": 0.6528, "grad_norm": 0.1316288709640503, "learning_rate": 4.656284173018144e-05, "loss": 1.1358039379119873, "mean_token_accuracy": 0.6633565202355385, "num_tokens": 6549817.0, "step": 51 }, { "entropy": 1.1398767530918121, "epoch": 0.6656, "grad_norm": 0.13040749728679657, "learning_rate": 4.638410650401267e-05, "loss": 1.1272315979003906, "mean_token_accuracy": 0.6667839512228966, "num_tokens": 6678766.0, "step": 52 }, { "entropy": 1.1322846412658691, "epoch": 0.6784, "grad_norm": 0.14328311383724213, "learning_rate": 4.620120240391065e-05, "loss": 1.117470145225525, "mean_token_accuracy": 0.6683860421180725, "num_tokens": 6808175.0, "step": 53 }, { "entropy": 1.1198230981826782, "epoch": 0.6912, "grad_norm": 0.14016754925251007, "learning_rate": 4.601416508739211e-05, "loss": 1.1076020002365112, "mean_token_accuracy": 0.6711939796805382, "num_tokens": 6936347.0, "step": 54 }, { "entropy": 1.1406737715005875, "epoch": 0.704, "grad_norm": 0.12862594425678253, "learning_rate": 4.5823031017752485e-05, "loss": 1.130237340927124, "mean_token_accuracy": 0.6678624600172043, "num_tokens": 7065783.0, "step": 55 }, { "entropy": 1.1166451126337051, "epoch": 0.7168, "grad_norm": 0.13933686912059784, "learning_rate": 4.562783745695738e-05, "loss": 1.1190818548202515, "mean_token_accuracy": 0.6695680469274521, "num_tokens": 7195341.0, "step": 56 }, { "entropy": 1.0982198119163513, "epoch": 0.7296, "grad_norm": 0.1453101933002472, "learning_rate": 4.542862245837821e-05, "loss": 1.0977050065994263, "mean_token_accuracy": 0.673400916159153, "num_tokens": 7323591.0, "step": 57 }, { "entropy": 1.1204975843429565, "epoch": 0.7424, "grad_norm": 0.14185063540935516, "learning_rate": 4.522542485937369e-05, "loss": 1.1112452745437622, "mean_token_accuracy": 0.6700539514422417, "num_tokens": 7449876.0, "step": 58 }, { "entropy": 1.0963227897882462, "epoch": 0.7552, "grad_norm": 0.1320878118276596, "learning_rate": 4.5018284273718336e-05, "loss": 1.0801842212677002, "mean_token_accuracy": 0.6790826618671417, "num_tokens": 7576398.0, "step": 59 }, { "entropy": 1.101280301809311, "epoch": 0.768, "grad_norm": 0.13114839792251587, "learning_rate": 4.480724108387977e-05, "loss": 1.0857573747634888, "mean_token_accuracy": 0.6782229617238045, "num_tokens": 7703463.0, "step": 60 }, { "entropy": 1.1046365648508072, "epoch": 0.7808, "grad_norm": 0.14528152346611023, "learning_rate": 4.4592336433146e-05, "loss": 1.0996856689453125, "mean_token_accuracy": 0.6730064377188683, "num_tokens": 7829441.0, "step": 61 }, { "entropy": 1.0932775139808655, "epoch": 0.7936, "grad_norm": 0.1349162608385086, "learning_rate": 4.4373612217604496e-05, "loss": 1.086916208267212, "mean_token_accuracy": 0.6765137910842896, "num_tokens": 7958502.0, "step": 62 }, { "entropy": 1.0945100337266922, "epoch": 0.8064, "grad_norm": 0.13429976999759674, "learning_rate": 4.415111107797445e-05, "loss": 1.0971022844314575, "mean_token_accuracy": 0.6743359267711639, "num_tokens": 8085295.0, "step": 63 }, { "entropy": 1.118965595960617, "epoch": 0.8192, "grad_norm": 0.1320214867591858, "learning_rate": 4.3924876391293915e-05, "loss": 1.1191140413284302, "mean_token_accuracy": 0.6683387905359268, "num_tokens": 8211901.0, "step": 64 }, { "entropy": 1.0775217562913895, "epoch": 0.832, "grad_norm": 0.13175779581069946, "learning_rate": 4.36949522624633e-05, "loss": 1.0712368488311768, "mean_token_accuracy": 0.6812888830900192, "num_tokens": 8341017.0, "step": 65 }, { "entropy": 1.0895331501960754, "epoch": 0.8448, "grad_norm": 0.13901865482330322, "learning_rate": 4.3461383515647106e-05, "loss": 1.0851002931594849, "mean_token_accuracy": 0.6775127947330475, "num_tokens": 8468968.0, "step": 66 }, { "entropy": 1.111844316124916, "epoch": 0.8576, "grad_norm": 0.1398841142654419, "learning_rate": 4.3224215685535294e-05, "loss": 1.1119290590286255, "mean_token_accuracy": 0.6691920980811119, "num_tokens": 8597358.0, "step": 67 }, { "entropy": 1.09650357067585, "epoch": 0.8704, "grad_norm": 0.12886422872543335, "learning_rate": 4.2983495008466276e-05, "loss": 1.0808916091918945, "mean_token_accuracy": 0.6781075149774551, "num_tokens": 8725371.0, "step": 68 }, { "entropy": 1.1017109751701355, "epoch": 0.8832, "grad_norm": 0.1451224386692047, "learning_rate": 4.273926841341302e-05, "loss": 1.0965564250946045, "mean_token_accuracy": 0.6711221262812614, "num_tokens": 8853595.0, "step": 69 }, { "entropy": 1.0767414420843124, "epoch": 0.896, "grad_norm": 0.13234680891036987, "learning_rate": 4.249158351283414e-05, "loss": 1.0748488903045654, "mean_token_accuracy": 0.6783607006072998, "num_tokens": 8983043.0, "step": 70 }, { "entropy": 1.1035151928663254, "epoch": 0.9088, "grad_norm": 0.14130030572414398, "learning_rate": 4.224048859339175e-05, "loss": 1.1003308296203613, "mean_token_accuracy": 0.6728062555193901, "num_tokens": 9108608.0, "step": 71 }, { "entropy": 1.0806768834590912, "epoch": 0.9216, "grad_norm": 0.13948991894721985, "learning_rate": 4.198603260653792e-05, "loss": 1.0670676231384277, "mean_token_accuracy": 0.680378146469593, "num_tokens": 9237077.0, "step": 72 }, { "entropy": 1.0983169227838516, "epoch": 0.9344, "grad_norm": 0.13928388059139252, "learning_rate": 4.172826515897146e-05, "loss": 1.0819404125213623, "mean_token_accuracy": 0.6768162399530411, "num_tokens": 9365880.0, "step": 73 }, { "entropy": 1.077269896864891, "epoch": 0.9472, "grad_norm": 0.12908564507961273, "learning_rate": 4.146723650296701e-05, "loss": 1.0671316385269165, "mean_token_accuracy": 0.6830117851495743, "num_tokens": 9495277.0, "step": 74 }, { "entropy": 1.0963009595870972, "epoch": 0.96, "grad_norm": 0.13727004826068878, "learning_rate": 4.1202997526578276e-05, "loss": 1.0920417308807373, "mean_token_accuracy": 0.6739914268255234, "num_tokens": 9622724.0, "step": 75 }, { "entropy": 1.0630004107952118, "epoch": 0.9728, "grad_norm": 0.12875896692276, "learning_rate": 4.093559974371725e-05, "loss": 1.0611292123794556, "mean_token_accuracy": 0.6826749593019485, "num_tokens": 9752552.0, "step": 76 }, { "entropy": 1.0773174464702606, "epoch": 0.9856, "grad_norm": 0.13426193594932556, "learning_rate": 4.066509528411152e-05, "loss": 1.0728553533554077, "mean_token_accuracy": 0.6800747960805893, "num_tokens": 9881931.0, "step": 77 }, { "entropy": 1.0630360692739487, "epoch": 0.9984, "grad_norm": 0.15215876698493958, "learning_rate": 4.039153688314145e-05, "loss": 1.0557889938354492, "mean_token_accuracy": 0.6812136247754097, "num_tokens": 10009540.0, "step": 78 }, { "entropy": 1.0610005855560303, "epoch": 1.0, "grad_norm": 0.3391527831554413, "learning_rate": 4.011497787155938e-05, "loss": 1.077329158782959, "mean_token_accuracy": 0.6696272492408752, "num_tokens": 10017540.0, "step": 79 }, { "entropy": 1.057944431900978, "epoch": 1.0128, "grad_norm": 0.13941514492034912, "learning_rate": 3.983547216509254e-05, "loss": 1.0362827777862549, "mean_token_accuracy": 0.6861638650298119, "num_tokens": 10145649.0, "step": 80 }, { "entropy": 1.067990705370903, "epoch": 1.0256, "grad_norm": 0.15004615485668182, "learning_rate": 3.955307425393224e-05, "loss": 1.0445749759674072, "mean_token_accuracy": 0.685584768652916, "num_tokens": 10274324.0, "step": 81 }, { "entropy": 1.0638910681009293, "epoch": 1.0384, "grad_norm": 0.15144135057926178, "learning_rate": 3.92678391921108e-05, "loss": 1.038772463798523, "mean_token_accuracy": 0.6854483857750893, "num_tokens": 10402159.0, "step": 82 }, { "entropy": 1.0502888560295105, "epoch": 1.0512, "grad_norm": 0.1476718783378601, "learning_rate": 3.897982258676867e-05, "loss": 1.032806396484375, "mean_token_accuracy": 0.6877381280064583, "num_tokens": 10528921.0, "step": 83 }, { "entropy": 1.0607359856367111, "epoch": 1.064, "grad_norm": 0.1483893245458603, "learning_rate": 3.868908058731376e-05, "loss": 1.0593475103378296, "mean_token_accuracy": 0.6811802610754967, "num_tokens": 10656940.0, "step": 84 }, { "entropy": 1.0237219482660294, "epoch": 1.0768, "grad_norm": 0.14610229432582855, "learning_rate": 3.8395669874474915e-05, "loss": 1.0263760089874268, "mean_token_accuracy": 0.6873858571052551, "num_tokens": 10785253.0, "step": 85 }, { "entropy": 1.0171761512756348, "epoch": 1.0896, "grad_norm": 0.13900278508663177, "learning_rate": 3.8099647649251986e-05, "loss": 1.0178409814834595, "mean_token_accuracy": 0.6926428601145744, "num_tokens": 10914475.0, "step": 86 }, { "entropy": 1.0242549777030945, "epoch": 1.1024, "grad_norm": 0.15527690947055817, "learning_rate": 3.780107162176429e-05, "loss": 1.0251739025115967, "mean_token_accuracy": 0.690009593963623, "num_tokens": 11043294.0, "step": 87 }, { "entropy": 1.0376387387514114, "epoch": 1.1152, "grad_norm": 0.14919476211071014, "learning_rate": 3.7500000000000003e-05, "loss": 1.0372812747955322, "mean_token_accuracy": 0.6861482635140419, "num_tokens": 11171407.0, "step": 88 }, { "entropy": 1.0412705391645432, "epoch": 1.1280000000000001, "grad_norm": 0.14314031600952148, "learning_rate": 3.719649147846832e-05, "loss": 1.0298428535461426, "mean_token_accuracy": 0.6876860409975052, "num_tokens": 11300200.0, "step": 89 }, { "entropy": 1.046479344367981, "epoch": 1.1408, "grad_norm": 0.14357109367847443, "learning_rate": 3.689060522675689e-05, "loss": 1.0436961650848389, "mean_token_accuracy": 0.6840986981987953, "num_tokens": 11427720.0, "step": 90 }, { "entropy": 1.0444832816720009, "epoch": 1.1536, "grad_norm": 0.14601631462574005, "learning_rate": 3.6582400877996546e-05, "loss": 1.0388257503509521, "mean_token_accuracy": 0.6848597973585129, "num_tokens": 11555879.0, "step": 91 }, { "entropy": 1.0362992137670517, "epoch": 1.1663999999999999, "grad_norm": 0.14069858193397522, "learning_rate": 3.627193851723577e-05, "loss": 1.0188350677490234, "mean_token_accuracy": 0.6903941184282303, "num_tokens": 11683728.0, "step": 92 }, { "entropy": 1.0298311412334442, "epoch": 1.1792, "grad_norm": 0.1387937068939209, "learning_rate": 3.5959278669726935e-05, "loss": 1.0166690349578857, "mean_token_accuracy": 0.6924493312835693, "num_tokens": 11811595.0, "step": 93 }, { "entropy": 1.0351728200912476, "epoch": 1.192, "grad_norm": 0.14132815599441528, "learning_rate": 3.564448228912682e-05, "loss": 1.0216882228851318, "mean_token_accuracy": 0.6892998889088631, "num_tokens": 11940418.0, "step": 94 }, { "entropy": 1.026585191488266, "epoch": 1.2048, "grad_norm": 0.13901017606258392, "learning_rate": 3.532761074561355e-05, "loss": 1.021584153175354, "mean_token_accuracy": 0.6895899921655655, "num_tokens": 12069893.0, "step": 95 }, { "entropy": 1.0406753346323967, "epoch": 1.2176, "grad_norm": 0.14579491317272186, "learning_rate": 3.5008725813922386e-05, "loss": 1.0375534296035767, "mean_token_accuracy": 0.6865515261888504, "num_tokens": 12197874.0, "step": 96 }, { "entropy": 1.0241748169064522, "epoch": 1.2304, "grad_norm": 0.14298036694526672, "learning_rate": 3.4687889661302576e-05, "loss": 1.0175296068191528, "mean_token_accuracy": 0.6926979124546051, "num_tokens": 12325523.0, "step": 97 }, { "entropy": 1.0330202355980873, "epoch": 1.2432, "grad_norm": 0.14852355420589447, "learning_rate": 3.436516483539781e-05, "loss": 1.026180624961853, "mean_token_accuracy": 0.6885206624865532, "num_tokens": 12453957.0, "step": 98 }, { "entropy": 1.031974546611309, "epoch": 1.256, "grad_norm": 0.1451551616191864, "learning_rate": 3.4040614252052305e-05, "loss": 1.029019832611084, "mean_token_accuracy": 0.68779356777668, "num_tokens": 12582932.0, "step": 99 }, { "entropy": 1.0458147823810577, "epoch": 1.2688, "grad_norm": 0.1469789445400238, "learning_rate": 3.3714301183045385e-05, "loss": 1.041419267654419, "mean_token_accuracy": 0.6843385100364685, "num_tokens": 12709959.0, "step": 100 }, { "entropy": 1.0275584980845451, "epoch": 1.2816, "grad_norm": 0.1412278562784195, "learning_rate": 3.338628924375638e-05, "loss": 1.029524326324463, "mean_token_accuracy": 0.688622310757637, "num_tokens": 12840008.0, "step": 101 }, { "entropy": 1.050063706934452, "epoch": 1.2944, "grad_norm": 0.14754833281040192, "learning_rate": 3.305664238076278e-05, "loss": 1.047257423400879, "mean_token_accuracy": 0.6842105835676193, "num_tokens": 12968206.0, "step": 102 }, { "entropy": 1.01626917719841, "epoch": 1.3072, "grad_norm": 0.16974866390228271, "learning_rate": 3.272542485937369e-05, "loss": 1.000723123550415, "mean_token_accuracy": 0.6962596401572227, "num_tokens": 13096100.0, "step": 103 }, { "entropy": 1.027530312538147, "epoch": 1.32, "grad_norm": 0.14281733334064484, "learning_rate": 3.239270125110117e-05, "loss": 1.0164220333099365, "mean_token_accuracy": 0.6905561611056328, "num_tokens": 13225387.0, "step": 104 }, { "entropy": 1.0216997936367989, "epoch": 1.3328, "grad_norm": 0.1458079218864441, "learning_rate": 3.205853642107192e-05, "loss": 1.0075095891952515, "mean_token_accuracy": 0.6948263943195343, "num_tokens": 13353629.0, "step": 105 }, { "entropy": 1.030478984117508, "epoch": 1.3456000000000001, "grad_norm": 0.17896829545497894, "learning_rate": 3.172299551538164e-05, "loss": 1.0213568210601807, "mean_token_accuracy": 0.6878650262951851, "num_tokens": 13479852.0, "step": 106 }, { "entropy": 1.039674311876297, "epoch": 1.3584, "grad_norm": 0.1448402851819992, "learning_rate": 3.138614394839476e-05, "loss": 1.042442798614502, "mean_token_accuracy": 0.683524414896965, "num_tokens": 13607703.0, "step": 107 }, { "entropy": 1.022900030016899, "epoch": 1.3712, "grad_norm": 0.14083491265773773, "learning_rate": 3.104804738999169e-05, "loss": 1.0171509981155396, "mean_token_accuracy": 0.6908959671854973, "num_tokens": 13735309.0, "step": 108 }, { "entropy": 1.0258008986711502, "epoch": 1.384, "grad_norm": 0.1457403004169464, "learning_rate": 3.0708771752766394e-05, "loss": 1.017960548400879, "mean_token_accuracy": 0.691944383084774, "num_tokens": 13860919.0, "step": 109 }, { "entropy": 1.0283809155225754, "epoch": 1.3968, "grad_norm": 0.14442399144172668, "learning_rate": 3.0368383179176585e-05, "loss": 1.0272858142852783, "mean_token_accuracy": 0.6892063394188881, "num_tokens": 13989591.0, "step": 110 }, { "entropy": 1.014742635190487, "epoch": 1.4096, "grad_norm": 0.14124004542827606, "learning_rate": 3.002694802864912e-05, "loss": 0.9993501901626587, "mean_token_accuracy": 0.6947403773665428, "num_tokens": 14117810.0, "step": 111 }, { "entropy": 1.016780748963356, "epoch": 1.4224, "grad_norm": 0.1471729427576065, "learning_rate": 2.9684532864643122e-05, "loss": 1.0125102996826172, "mean_token_accuracy": 0.6930836960673332, "num_tokens": 14242788.0, "step": 112 }, { "entropy": 1.0173302441835403, "epoch": 1.4352, "grad_norm": 0.13925546407699585, "learning_rate": 2.9341204441673266e-05, "loss": 1.0153708457946777, "mean_token_accuracy": 0.6915621310472488, "num_tokens": 14371615.0, "step": 113 }, { "entropy": 1.0239159166812897, "epoch": 1.448, "grad_norm": 0.14313757419586182, "learning_rate": 2.8997029692295874e-05, "loss": 1.0213682651519775, "mean_token_accuracy": 0.6906882151961327, "num_tokens": 14500253.0, "step": 114 }, { "entropy": 1.0035353675484657, "epoch": 1.4607999999999999, "grad_norm": 0.13895684480667114, "learning_rate": 2.8652075714060295e-05, "loss": 1.000422477722168, "mean_token_accuracy": 0.6950262412428856, "num_tokens": 14628433.0, "step": 115 }, { "entropy": 1.0296125635504723, "epoch": 1.4736, "grad_norm": 0.14564120769500732, "learning_rate": 2.8306409756428064e-05, "loss": 1.0179723501205444, "mean_token_accuracy": 0.6900328099727631, "num_tokens": 14756107.0, "step": 116 }, { "entropy": 1.0249193534255028, "epoch": 1.4864, "grad_norm": 0.13886931538581848, "learning_rate": 2.7960099207662532e-05, "loss": 1.0143296718597412, "mean_token_accuracy": 0.6901694238185883, "num_tokens": 14885841.0, "step": 117 }, { "entropy": 1.0198340266942978, "epoch": 1.4992, "grad_norm": 0.14387960731983185, "learning_rate": 2.761321158169134e-05, "loss": 1.0158933401107788, "mean_token_accuracy": 0.693331778049469, "num_tokens": 15014900.0, "step": 118 }, { "entropy": 1.0240024253726006, "epoch": 1.512, "grad_norm": 0.14001767337322235, "learning_rate": 2.726581450494451e-05, "loss": 1.0160140991210938, "mean_token_accuracy": 0.6910362392663956, "num_tokens": 15140121.0, "step": 119 }, { "entropy": 1.0351693704724312, "epoch": 1.5248, "grad_norm": 0.1424434930086136, "learning_rate": 2.6917975703170466e-05, "loss": 1.0207040309906006, "mean_token_accuracy": 0.6915217339992523, "num_tokens": 15268220.0, "step": 120 }, { "entropy": 1.0331912711262703, "epoch": 1.5375999999999999, "grad_norm": 0.1435452103614807, "learning_rate": 2.656976298823284e-05, "loss": 1.022803544998169, "mean_token_accuracy": 0.6881031021475792, "num_tokens": 15396740.0, "step": 121 }, { "entropy": 1.0098799914121628, "epoch": 1.5504, "grad_norm": 0.15354876220226288, "learning_rate": 2.6221244244890336e-05, "loss": 1.0064752101898193, "mean_token_accuracy": 0.6923821792006493, "num_tokens": 15525918.0, "step": 122 }, { "entropy": 1.0045136064291, "epoch": 1.5632000000000001, "grad_norm": 0.15096060931682587, "learning_rate": 2.587248741756253e-05, "loss": 0.9965898394584656, "mean_token_accuracy": 0.6942028999328613, "num_tokens": 15653798.0, "step": 123 }, { "entropy": 1.0153604969382286, "epoch": 1.576, "grad_norm": 0.1559235155582428, "learning_rate": 2.5523560497083926e-05, "loss": 1.0174250602722168, "mean_token_accuracy": 0.6916217133402824, "num_tokens": 15780901.0, "step": 124 }, { "entropy": 1.0135911107063293, "epoch": 1.5888, "grad_norm": 0.15615662932395935, "learning_rate": 2.517453150744904e-05, "loss": 1.0026178359985352, "mean_token_accuracy": 0.6925746351480484, "num_tokens": 15910081.0, "step": 125 }, { "entropy": 1.024174876511097, "epoch": 1.6016, "grad_norm": 0.14676935970783234, "learning_rate": 2.4825468492550964e-05, "loss": 1.0253103971481323, "mean_token_accuracy": 0.6872480884194374, "num_tokens": 16039988.0, "step": 126 }, { "entropy": 1.0215316414833069, "epoch": 1.6143999999999998, "grad_norm": 0.14772795140743256, "learning_rate": 2.447643950291608e-05, "loss": 1.0158052444458008, "mean_token_accuracy": 0.6926918849349022, "num_tokens": 16168000.0, "step": 127 }, { "entropy": 1.0269628539681435, "epoch": 1.6272, "grad_norm": 0.159188911318779, "learning_rate": 2.4127512582437485e-05, "loss": 1.0269343852996826, "mean_token_accuracy": 0.6895755901932716, "num_tokens": 16297540.0, "step": 128 }, { "entropy": 1.0223316550254822, "epoch": 1.6400000000000001, "grad_norm": 0.15721148252487183, "learning_rate": 2.377875575510967e-05, "loss": 1.0127532482147217, "mean_token_accuracy": 0.6900231316685677, "num_tokens": 16427044.0, "step": 129 }, { "entropy": 1.0085494741797447, "epoch": 1.6528, "grad_norm": 0.14220507442951202, "learning_rate": 2.3430237011767167e-05, "loss": 1.0012016296386719, "mean_token_accuracy": 0.6937322989106178, "num_tokens": 16556253.0, "step": 130 }, { "entropy": 1.0213414132595062, "epoch": 1.6656, "grad_norm": 0.14747366309165955, "learning_rate": 2.3082024296829536e-05, "loss": 1.0079940557479858, "mean_token_accuracy": 0.6933478713035583, "num_tokens": 16684674.0, "step": 131 }, { "entropy": 0.9775404036045074, "epoch": 1.6784, "grad_norm": 0.14372865855693817, "learning_rate": 2.2734185495055503e-05, "loss": 0.9752405285835266, "mean_token_accuracy": 0.6997648701071739, "num_tokens": 16813433.0, "step": 132 }, { "entropy": 1.0255391001701355, "epoch": 1.6912, "grad_norm": 0.14679594337940216, "learning_rate": 2.238678841830867e-05, "loss": 1.0157995223999023, "mean_token_accuracy": 0.6912272796034813, "num_tokens": 16942464.0, "step": 133 }, { "entropy": 1.0093939751386642, "epoch": 1.704, "grad_norm": 0.14213216304779053, "learning_rate": 2.2039900792337474e-05, "loss": 1.0053470134735107, "mean_token_accuracy": 0.6922042742371559, "num_tokens": 17068724.0, "step": 134 }, { "entropy": 1.0206375867128372, "epoch": 1.7168, "grad_norm": 0.1582878679037094, "learning_rate": 2.1693590243571938e-05, "loss": 1.015845537185669, "mean_token_accuracy": 0.6909609735012054, "num_tokens": 17197871.0, "step": 135 }, { "entropy": 1.0280367136001587, "epoch": 1.7296, "grad_norm": 0.14381150901317596, "learning_rate": 2.1347924285939714e-05, "loss": 1.0239794254302979, "mean_token_accuracy": 0.690137580037117, "num_tokens": 17327107.0, "step": 136 }, { "entropy": 1.0049420967698097, "epoch": 1.7424, "grad_norm": 0.13888318836688995, "learning_rate": 2.1002970307704132e-05, "loss": 0.9952517747879028, "mean_token_accuracy": 0.696092315018177, "num_tokens": 17455256.0, "step": 137 }, { "entropy": 1.0143049955368042, "epoch": 1.7551999999999999, "grad_norm": 0.14273257553577423, "learning_rate": 2.0658795558326743e-05, "loss": 1.0057284832000732, "mean_token_accuracy": 0.6924818381667137, "num_tokens": 17584010.0, "step": 138 }, { "entropy": 0.9956570863723755, "epoch": 1.768, "grad_norm": 0.14681822061538696, "learning_rate": 2.031546713535688e-05, "loss": 0.9961063265800476, "mean_token_accuracy": 0.695470467209816, "num_tokens": 17712152.0, "step": 139 }, { "entropy": 1.002347745001316, "epoch": 1.7808000000000002, "grad_norm": 0.1409362256526947, "learning_rate": 1.9973051971350888e-05, "loss": 0.9963667392730713, "mean_token_accuracy": 0.6953927576541901, "num_tokens": 17841435.0, "step": 140 }, { "entropy": 1.001997910439968, "epoch": 1.7936, "grad_norm": 0.1434098333120346, "learning_rate": 1.963161682082342e-05, "loss": 0.9935073256492615, "mean_token_accuracy": 0.6966547071933746, "num_tokens": 17970685.0, "step": 141 }, { "entropy": 0.9948462694883347, "epoch": 1.8064, "grad_norm": 0.1479790061712265, "learning_rate": 1.9291228247233605e-05, "loss": 0.9818427562713623, "mean_token_accuracy": 0.6990911811590195, "num_tokens": 18097293.0, "step": 142 }, { "entropy": 0.9982151091098785, "epoch": 1.8192, "grad_norm": 0.1407081037759781, "learning_rate": 1.895195261000831e-05, "loss": 0.990318775177002, "mean_token_accuracy": 0.6987427324056625, "num_tokens": 18225428.0, "step": 143 }, { "entropy": 1.0017137452960014, "epoch": 1.8319999999999999, "grad_norm": 0.14032679796218872, "learning_rate": 1.8613856051605243e-05, "loss": 0.999521017074585, "mean_token_accuracy": 0.6932288855314255, "num_tokens": 18353477.0, "step": 144 }, { "entropy": 1.0164642632007599, "epoch": 1.8448, "grad_norm": 0.14262859523296356, "learning_rate": 1.827700448461836e-05, "loss": 1.0056393146514893, "mean_token_accuracy": 0.6931333243846893, "num_tokens": 18483688.0, "step": 145 }, { "entropy": 0.9947623461484909, "epoch": 1.8576000000000001, "grad_norm": 0.14257821440696716, "learning_rate": 1.7941463578928086e-05, "loss": 1.0008827447891235, "mean_token_accuracy": 0.6947742477059364, "num_tokens": 18611470.0, "step": 146 }, { "entropy": 1.0136389061808586, "epoch": 1.8704, "grad_norm": 0.1465529501438141, "learning_rate": 1.7607298748898842e-05, "loss": 1.0022717714309692, "mean_token_accuracy": 0.6935647279024124, "num_tokens": 18739417.0, "step": 147 }, { "entropy": 0.9927093759179115, "epoch": 1.8832, "grad_norm": 0.13819244503974915, "learning_rate": 1.7274575140626318e-05, "loss": 0.979236900806427, "mean_token_accuracy": 0.6986266896128654, "num_tokens": 18868633.0, "step": 148 }, { "entropy": 0.9977058917284012, "epoch": 1.896, "grad_norm": 0.14210258424282074, "learning_rate": 1.6943357619237226e-05, "loss": 0.9892839193344116, "mean_token_accuracy": 0.6953017637133598, "num_tokens": 18997174.0, "step": 149 }, { "entropy": 1.0145854726433754, "epoch": 1.9088, "grad_norm": 0.14142665266990662, "learning_rate": 1.6613710756243626e-05, "loss": 1.0118539333343506, "mean_token_accuracy": 0.6924030184745789, "num_tokens": 19126262.0, "step": 150 }, { "entropy": 0.9954518750309944, "epoch": 1.9216, "grad_norm": 0.1441740244626999, "learning_rate": 1.6285698816954624e-05, "loss": 0.9903876781463623, "mean_token_accuracy": 0.6964381784200668, "num_tokens": 19255187.0, "step": 151 }, { "entropy": 0.999088779091835, "epoch": 1.9344000000000001, "grad_norm": 0.14101152122020721, "learning_rate": 1.5959385747947698e-05, "loss": 0.99430912733078, "mean_token_accuracy": 0.6954821571707726, "num_tokens": 19382468.0, "step": 152 }, { "entropy": 1.0051404386758804, "epoch": 1.9472, "grad_norm": 0.14272092282772064, "learning_rate": 1.56348351646022e-05, "loss": 1.0007083415985107, "mean_token_accuracy": 0.6927858367562294, "num_tokens": 19512195.0, "step": 153 }, { "entropy": 1.021784469485283, "epoch": 1.96, "grad_norm": 0.1406528651714325, "learning_rate": 1.5312110338697426e-05, "loss": 1.0162166357040405, "mean_token_accuracy": 0.6914241835474968, "num_tokens": 19642358.0, "step": 154 }, { "entropy": 0.9982958510518074, "epoch": 1.9727999999999999, "grad_norm": 0.144367054104805, "learning_rate": 1.4991274186077632e-05, "loss": 0.994674026966095, "mean_token_accuracy": 0.6925558745861053, "num_tokens": 19769861.0, "step": 155 }, { "entropy": 1.0118654742836952, "epoch": 1.9856, "grad_norm": 0.14789123833179474, "learning_rate": 1.467238925438646e-05, "loss": 1.0072314739227295, "mean_token_accuracy": 0.6919693425297737, "num_tokens": 19898556.0, "step": 156 }, { "entropy": 1.004975602030754, "epoch": 1.9984, "grad_norm": 0.14627470076084137, "learning_rate": 1.4355517710873184e-05, "loss": 0.996126651763916, "mean_token_accuracy": 0.694159097969532, "num_tokens": 20026889.0, "step": 157 }, { "entropy": 1.0182693004608154, "epoch": 2.0, "grad_norm": 0.37654629349708557, "learning_rate": 1.4040721330273062e-05, "loss": 0.9920079708099365, "mean_token_accuracy": 0.6773799061775208, "num_tokens": 20035080.0, "step": 158 } ], "logging_steps": 1, "max_steps": 237, "num_input_tokens_seen": 0, "num_train_epochs": 3, "save_steps": 500, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 2.1153161977077432e+18, "train_batch_size": 1, "trial_name": null, "trial_params": null }