{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 1.0, "eval_steps": 500, "global_step": 79, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "entropy": 1.3162457048892975, "epoch": 0.0128, "grad_norm": 1.352159857749939, "learning_rate": 0.0, "loss": 2.1207475662231445, "mean_token_accuracy": 0.519522450864315, "num_tokens": 128267.0, "step": 1 }, { "entropy": 1.3375049829483032, "epoch": 0.0256, "grad_norm": 1.3233879804611206, "learning_rate": 4.166666666666667e-06, "loss": 2.1054062843322754, "mean_token_accuracy": 0.5206284299492836, "num_tokens": 253824.0, "step": 2 }, { "entropy": 1.4048671871423721, "epoch": 0.0384, "grad_norm": 1.2062019109725952, "learning_rate": 8.333333333333334e-06, "loss": 2.087756633758545, "mean_token_accuracy": 0.5199320912361145, "num_tokens": 382699.0, "step": 3 }, { "entropy": 1.5049891620874405, "epoch": 0.0512, "grad_norm": 0.9262659549713135, "learning_rate": 1.25e-05, "loss": 1.995165467262268, "mean_token_accuracy": 0.5279128178954124, "num_tokens": 511796.0, "step": 4 }, { "entropy": 1.6395027190446854, "epoch": 0.064, "grad_norm": 0.6157782673835754, "learning_rate": 1.6666666666666667e-05, "loss": 1.902457594871521, "mean_token_accuracy": 0.5378688499331474, "num_tokens": 639293.0, "step": 5 }, { "entropy": 1.7712273597717285, "epoch": 0.0768, "grad_norm": 0.41292306780815125, "learning_rate": 2.0833333333333336e-05, "loss": 1.814640998840332, "mean_token_accuracy": 0.551142543554306, "num_tokens": 768431.0, "step": 6 }, { "entropy": 1.9540852010250092, "epoch": 0.0896, "grad_norm": 0.501342236995697, "learning_rate": 2.5e-05, "loss": 1.7964210510253906, "mean_token_accuracy": 0.5524477660655975, "num_tokens": 896030.0, "step": 7 }, { "entropy": 2.001556009054184, "epoch": 0.1024, "grad_norm": 0.5916482210159302, "learning_rate": 2.916666666666667e-05, "loss": 1.74098801612854, "mean_token_accuracy": 0.5590195059776306, "num_tokens": 1024099.0, "step": 8 }, { "entropy": 1.8932171761989594, "epoch": 0.1152, "grad_norm": 0.5141144394874573, "learning_rate": 3.3333333333333335e-05, "loss": 1.6654725074768066, "mean_token_accuracy": 0.5705089494585991, "num_tokens": 1151261.0, "step": 9 }, { "entropy": 1.7713737785816193, "epoch": 0.128, "grad_norm": 0.38611456751823425, "learning_rate": 3.7500000000000003e-05, "loss": 1.6301219463348389, "mean_token_accuracy": 0.5723346620798111, "num_tokens": 1280169.0, "step": 10 }, { "entropy": 1.5953099429607391, "epoch": 0.1408, "grad_norm": 0.3014231324195862, "learning_rate": 4.166666666666667e-05, "loss": 1.563348412513733, "mean_token_accuracy": 0.5855296552181244, "num_tokens": 1408663.0, "step": 11 }, { "entropy": 1.498468354344368, "epoch": 0.1536, "grad_norm": 0.29069405794143677, "learning_rate": 4.5833333333333334e-05, "loss": 1.5376625061035156, "mean_token_accuracy": 0.5896067395806313, "num_tokens": 1537364.0, "step": 12 }, { "entropy": 1.4390365332365036, "epoch": 0.1664, "grad_norm": 0.2850739359855652, "learning_rate": 5e-05, "loss": 1.5183324813842773, "mean_token_accuracy": 0.5939378440380096, "num_tokens": 1665784.0, "step": 13 }, { "entropy": 1.3894367814064026, "epoch": 0.1792, "grad_norm": 0.254903644323349, "learning_rate": 4.999756310023261e-05, "loss": 1.4691948890686035, "mean_token_accuracy": 0.6029341071844101, "num_tokens": 1793645.0, "step": 14 }, { "entropy": 1.3888143301010132, "epoch": 0.192, "grad_norm": 0.2366946041584015, "learning_rate": 4.999025287600886e-05, "loss": 1.437840461730957, "mean_token_accuracy": 0.6058616042137146, "num_tokens": 1923235.0, "step": 15 }, { "entropy": 1.38721963763237, "epoch": 0.2048, "grad_norm": 0.24185693264007568, "learning_rate": 4.997807075247146e-05, "loss": 1.388806939125061, "mean_token_accuracy": 0.6189781129360199, "num_tokens": 2047392.0, "step": 16 }, { "entropy": 1.411361888051033, "epoch": 0.2176, "grad_norm": 0.2459052950143814, "learning_rate": 4.996101910454953e-05, "loss": 1.3761913776397705, "mean_token_accuracy": 0.6179594621062279, "num_tokens": 2176102.0, "step": 17 }, { "entropy": 1.4147253632545471, "epoch": 0.2304, "grad_norm": 0.19693808257579803, "learning_rate": 4.993910125649561e-05, "loss": 1.3652762174606323, "mean_token_accuracy": 0.621271513402462, "num_tokens": 2306210.0, "step": 18 }, { "entropy": 1.3803435266017914, "epoch": 0.2432, "grad_norm": 0.19281397759914398, "learning_rate": 4.991232148123761e-05, "loss": 1.3464841842651367, "mean_token_accuracy": 0.6208974272012711, "num_tokens": 2435600.0, "step": 19 }, { "entropy": 1.35707126557827, "epoch": 0.256, "grad_norm": 0.18975713849067688, "learning_rate": 4.988068499954578e-05, "loss": 1.3281123638153076, "mean_token_accuracy": 0.6283634603023529, "num_tokens": 2563297.0, "step": 20 }, { "entropy": 1.3186347782611847, "epoch": 0.2688, "grad_norm": 0.18689435720443726, "learning_rate": 4.984419797901491e-05, "loss": 1.2913005352020264, "mean_token_accuracy": 0.6341830417513847, "num_tokens": 2693321.0, "step": 21 }, { "entropy": 1.2915433645248413, "epoch": 0.2816, "grad_norm": 0.16926461458206177, "learning_rate": 4.980286753286195e-05, "loss": 1.2752561569213867, "mean_token_accuracy": 0.6396686807274818, "num_tokens": 2822308.0, "step": 22 }, { "entropy": 1.3217644691467285, "epoch": 0.2944, "grad_norm": 0.17539748549461365, "learning_rate": 4.975670171853926e-05, "loss": 1.2967042922973633, "mean_token_accuracy": 0.6322600916028023, "num_tokens": 2948321.0, "step": 23 }, { "entropy": 1.305735170841217, "epoch": 0.3072, "grad_norm": 0.18748317658901215, "learning_rate": 4.9705709536163824e-05, "loss": 1.2801027297973633, "mean_token_accuracy": 0.6383148655295372, "num_tokens": 3075824.0, "step": 24 }, { "entropy": 1.2684594690799713, "epoch": 0.32, "grad_norm": 0.17818772792816162, "learning_rate": 4.964990092676263e-05, "loss": 1.2617098093032837, "mean_token_accuracy": 0.6398709714412689, "num_tokens": 3204534.0, "step": 25 }, { "entropy": 1.2367210537195206, "epoch": 0.3328, "grad_norm": 0.15789498388767242, "learning_rate": 4.9589286770334654e-05, "loss": 1.237747073173523, "mean_token_accuracy": 0.6457515805959702, "num_tokens": 3332525.0, "step": 26 }, { "entropy": 1.26371830701828, "epoch": 0.3456, "grad_norm": 0.15905392169952393, "learning_rate": 4.952387888372979e-05, "loss": 1.2668375968933105, "mean_token_accuracy": 0.6412620171904564, "num_tokens": 3461036.0, "step": 27 }, { "entropy": 1.2327947914600372, "epoch": 0.3584, "grad_norm": 0.1592377871274948, "learning_rate": 4.9453690018345144e-05, "loss": 1.234164834022522, "mean_token_accuracy": 0.6465037614107132, "num_tokens": 3589380.0, "step": 28 }, { "entropy": 1.225911945104599, "epoch": 0.3712, "grad_norm": 0.16118580102920532, "learning_rate": 4.937873385763908e-05, "loss": 1.2210657596588135, "mean_token_accuracy": 0.648338608443737, "num_tokens": 3717664.0, "step": 29 }, { "entropy": 1.2561272978782654, "epoch": 0.384, "grad_norm": 0.1599515676498413, "learning_rate": 4.929902501446366e-05, "loss": 1.2360204458236694, "mean_token_accuracy": 0.6447968706488609, "num_tokens": 3844833.0, "step": 30 }, { "entropy": 1.239769622683525, "epoch": 0.3968, "grad_norm": 0.15974652767181396, "learning_rate": 4.9214579028215776e-05, "loss": 1.2166938781738281, "mean_token_accuracy": 0.6490442007780075, "num_tokens": 3974478.0, "step": 31 }, { "entropy": 1.239488497376442, "epoch": 0.4096, "grad_norm": 0.1755683869123459, "learning_rate": 4.912541236180779e-05, "loss": 1.2133210897445679, "mean_token_accuracy": 0.651265911757946, "num_tokens": 4104263.0, "step": 32 }, { "entropy": 1.223443627357483, "epoch": 0.4224, "grad_norm": 0.15209320187568665, "learning_rate": 4.9031542398457974e-05, "loss": 1.202136754989624, "mean_token_accuracy": 0.6539920642971992, "num_tokens": 4233892.0, "step": 33 }, { "entropy": 1.2144603580236435, "epoch": 0.4352, "grad_norm": 0.1438663750886917, "learning_rate": 4.893298743830168e-05, "loss": 1.2046866416931152, "mean_token_accuracy": 0.6516713947057724, "num_tokens": 4362313.0, "step": 34 }, { "entropy": 1.2047844678163528, "epoch": 0.448, "grad_norm": 0.14309684932231903, "learning_rate": 4.882976669482367e-05, "loss": 1.1985797882080078, "mean_token_accuracy": 0.6538008749485016, "num_tokens": 4490686.0, "step": 35 }, { "entropy": 1.155385822057724, "epoch": 0.4608, "grad_norm": 0.1452430784702301, "learning_rate": 4.8721900291112415e-05, "loss": 1.1461997032165527, "mean_token_accuracy": 0.6639315262436867, "num_tokens": 4618481.0, "step": 36 }, { "entropy": 1.1931456923484802, "epoch": 0.4736, "grad_norm": 0.14111614227294922, "learning_rate": 4.860940925593703e-05, "loss": 1.1837263107299805, "mean_token_accuracy": 0.6538461446762085, "num_tokens": 4746449.0, "step": 37 }, { "entropy": 1.2137931138277054, "epoch": 0.4864, "grad_norm": 0.1422092169523239, "learning_rate": 4.849231551964771e-05, "loss": 1.1992123126983643, "mean_token_accuracy": 0.6522813364863396, "num_tokens": 4875695.0, "step": 38 }, { "entropy": 1.1690412908792496, "epoch": 0.4992, "grad_norm": 0.14533959329128265, "learning_rate": 4.837064190990036e-05, "loss": 1.1562764644622803, "mean_token_accuracy": 0.6618529111146927, "num_tokens": 5002824.0, "step": 39 }, { "entropy": 1.163830503821373, "epoch": 0.512, "grad_norm": 0.14272262156009674, "learning_rate": 4.8244412147206284e-05, "loss": 1.1516133546829224, "mean_token_accuracy": 0.6619244366884232, "num_tokens": 5132045.0, "step": 40 }, { "entropy": 1.148694396018982, "epoch": 0.5248, "grad_norm": 0.13471876084804535, "learning_rate": 4.8113650840307834e-05, "loss": 1.1472002267837524, "mean_token_accuracy": 0.6657932102680206, "num_tokens": 5261038.0, "step": 41 }, { "entropy": 1.1257383078336716, "epoch": 0.5376, "grad_norm": 0.1379338800907135, "learning_rate": 4.797838348138086e-05, "loss": 1.1339021921157837, "mean_token_accuracy": 0.6660185307264328, "num_tokens": 5388912.0, "step": 42 }, { "entropy": 1.1311924755573273, "epoch": 0.5504, "grad_norm": 0.14049763977527618, "learning_rate": 4.783863644106502e-05, "loss": 1.135345697402954, "mean_token_accuracy": 0.6648508384823799, "num_tokens": 5518618.0, "step": 43 }, { "entropy": 1.1455007046461105, "epoch": 0.5632, "grad_norm": 0.13285057246685028, "learning_rate": 4.769443696332272e-05, "loss": 1.1532269716262817, "mean_token_accuracy": 0.6633262932300568, "num_tokens": 5648116.0, "step": 44 }, { "entropy": 1.1428617984056473, "epoch": 0.576, "grad_norm": 0.13333706557750702, "learning_rate": 4.754581316012785e-05, "loss": 1.1316198110580444, "mean_token_accuracy": 0.668374814093113, "num_tokens": 5777117.0, "step": 45 }, { "entropy": 1.1585663259029388, "epoch": 0.5888, "grad_norm": 0.14425642788410187, "learning_rate": 4.7392794005985326e-05, "loss": 1.1365997791290283, "mean_token_accuracy": 0.6671516969799995, "num_tokens": 5904876.0, "step": 46 }, { "entropy": 1.150609478354454, "epoch": 0.6016, "grad_norm": 0.15504664182662964, "learning_rate": 4.723540933228244e-05, "loss": 1.127173662185669, "mean_token_accuracy": 0.6687930002808571, "num_tokens": 6034768.0, "step": 47 }, { "entropy": 1.1596223711967468, "epoch": 0.6144, "grad_norm": 0.12928146123886108, "learning_rate": 4.707368982147318e-05, "loss": 1.1445682048797607, "mean_token_accuracy": 0.6648146286606789, "num_tokens": 6163126.0, "step": 48 }, { "entropy": 1.0994263589382172, "epoch": 0.6272, "grad_norm": 0.1349116712808609, "learning_rate": 4.690766700109659e-05, "loss": 1.0948941707611084, "mean_token_accuracy": 0.6754020154476166, "num_tokens": 6291570.0, "step": 49 }, { "entropy": 1.112744465470314, "epoch": 0.64, "grad_norm": 0.14497768878936768, "learning_rate": 4.6737373237630476e-05, "loss": 1.1113452911376953, "mean_token_accuracy": 0.6713321506977081, "num_tokens": 6420084.0, "step": 50 }, { "entropy": 1.1346999406814575, "epoch": 0.6528, "grad_norm": 0.1316288709640503, "learning_rate": 4.656284173018144e-05, "loss": 1.1358039379119873, "mean_token_accuracy": 0.6633565202355385, "num_tokens": 6549817.0, "step": 51 }, { "entropy": 1.1398767530918121, "epoch": 0.6656, "grad_norm": 0.13040749728679657, "learning_rate": 4.638410650401267e-05, "loss": 1.1272315979003906, "mean_token_accuracy": 0.6667839512228966, "num_tokens": 6678766.0, "step": 52 }, { "entropy": 1.1322846412658691, "epoch": 0.6784, "grad_norm": 0.14328311383724213, "learning_rate": 4.620120240391065e-05, "loss": 1.117470145225525, "mean_token_accuracy": 0.6683860421180725, "num_tokens": 6808175.0, "step": 53 }, { "entropy": 1.1198230981826782, "epoch": 0.6912, "grad_norm": 0.14016754925251007, "learning_rate": 4.601416508739211e-05, "loss": 1.1076020002365112, "mean_token_accuracy": 0.6711939796805382, "num_tokens": 6936347.0, "step": 54 }, { "entropy": 1.1406737715005875, "epoch": 0.704, "grad_norm": 0.12862594425678253, "learning_rate": 4.5823031017752485e-05, "loss": 1.130237340927124, "mean_token_accuracy": 0.6678624600172043, "num_tokens": 7065783.0, "step": 55 }, { "entropy": 1.1166451126337051, "epoch": 0.7168, "grad_norm": 0.13933686912059784, "learning_rate": 4.562783745695738e-05, "loss": 1.1190818548202515, "mean_token_accuracy": 0.6695680469274521, "num_tokens": 7195341.0, "step": 56 }, { "entropy": 1.0982198119163513, "epoch": 0.7296, "grad_norm": 0.1453101933002472, "learning_rate": 4.542862245837821e-05, "loss": 1.0977050065994263, "mean_token_accuracy": 0.673400916159153, "num_tokens": 7323591.0, "step": 57 }, { "entropy": 1.1204975843429565, "epoch": 0.7424, "grad_norm": 0.14185063540935516, "learning_rate": 4.522542485937369e-05, "loss": 1.1112452745437622, "mean_token_accuracy": 0.6700539514422417, "num_tokens": 7449876.0, "step": 58 }, { "entropy": 1.0963227897882462, "epoch": 0.7552, "grad_norm": 0.1320878118276596, "learning_rate": 4.5018284273718336e-05, "loss": 1.0801842212677002, "mean_token_accuracy": 0.6790826618671417, "num_tokens": 7576398.0, "step": 59 }, { "entropy": 1.101280301809311, "epoch": 0.768, "grad_norm": 0.13114839792251587, "learning_rate": 4.480724108387977e-05, "loss": 1.0857573747634888, "mean_token_accuracy": 0.6782229617238045, "num_tokens": 7703463.0, "step": 60 }, { "entropy": 1.1046365648508072, "epoch": 0.7808, "grad_norm": 0.14528152346611023, "learning_rate": 4.4592336433146e-05, "loss": 1.0996856689453125, "mean_token_accuracy": 0.6730064377188683, "num_tokens": 7829441.0, "step": 61 }, { "entropy": 1.0932775139808655, "epoch": 0.7936, "grad_norm": 0.1349162608385086, "learning_rate": 4.4373612217604496e-05, "loss": 1.086916208267212, "mean_token_accuracy": 0.6765137910842896, "num_tokens": 7958502.0, "step": 62 }, { "entropy": 1.0945100337266922, "epoch": 0.8064, "grad_norm": 0.13429976999759674, "learning_rate": 4.415111107797445e-05, "loss": 1.0971022844314575, "mean_token_accuracy": 0.6743359267711639, "num_tokens": 8085295.0, "step": 63 }, { "entropy": 1.118965595960617, "epoch": 0.8192, "grad_norm": 0.1320214867591858, "learning_rate": 4.3924876391293915e-05, "loss": 1.1191140413284302, "mean_token_accuracy": 0.6683387905359268, "num_tokens": 8211901.0, "step": 64 }, { "entropy": 1.0775217562913895, "epoch": 0.832, "grad_norm": 0.13175779581069946, "learning_rate": 4.36949522624633e-05, "loss": 1.0712368488311768, "mean_token_accuracy": 0.6812888830900192, "num_tokens": 8341017.0, "step": 65 }, { "entropy": 1.0895331501960754, "epoch": 0.8448, "grad_norm": 0.13901865482330322, "learning_rate": 4.3461383515647106e-05, "loss": 1.0851002931594849, "mean_token_accuracy": 0.6775127947330475, "num_tokens": 8468968.0, "step": 66 }, { "entropy": 1.111844316124916, "epoch": 0.8576, "grad_norm": 0.1398841142654419, "learning_rate": 4.3224215685535294e-05, "loss": 1.1119290590286255, "mean_token_accuracy": 0.6691920980811119, "num_tokens": 8597358.0, "step": 67 }, { "entropy": 1.09650357067585, "epoch": 0.8704, "grad_norm": 0.12886422872543335, "learning_rate": 4.2983495008466276e-05, "loss": 1.0808916091918945, "mean_token_accuracy": 0.6781075149774551, "num_tokens": 8725371.0, "step": 68 }, { "entropy": 1.1017109751701355, "epoch": 0.8832, "grad_norm": 0.1451224386692047, "learning_rate": 4.273926841341302e-05, "loss": 1.0965564250946045, "mean_token_accuracy": 0.6711221262812614, "num_tokens": 8853595.0, "step": 69 }, { "entropy": 1.0767414420843124, "epoch": 0.896, "grad_norm": 0.13234680891036987, "learning_rate": 4.249158351283414e-05, "loss": 1.0748488903045654, "mean_token_accuracy": 0.6783607006072998, "num_tokens": 8983043.0, "step": 70 }, { "entropy": 1.1035151928663254, "epoch": 0.9088, "grad_norm": 0.14130030572414398, "learning_rate": 4.224048859339175e-05, "loss": 1.1003308296203613, "mean_token_accuracy": 0.6728062555193901, "num_tokens": 9108608.0, "step": 71 }, { "entropy": 1.0806768834590912, "epoch": 0.9216, "grad_norm": 0.13948991894721985, "learning_rate": 4.198603260653792e-05, "loss": 1.0670676231384277, "mean_token_accuracy": 0.680378146469593, "num_tokens": 9237077.0, "step": 72 }, { "entropy": 1.0983169227838516, "epoch": 0.9344, "grad_norm": 0.13928388059139252, "learning_rate": 4.172826515897146e-05, "loss": 1.0819404125213623, "mean_token_accuracy": 0.6768162399530411, "num_tokens": 9365880.0, "step": 73 }, { "entropy": 1.077269896864891, "epoch": 0.9472, "grad_norm": 0.12908564507961273, "learning_rate": 4.146723650296701e-05, "loss": 1.0671316385269165, "mean_token_accuracy": 0.6830117851495743, "num_tokens": 9495277.0, "step": 74 }, { "entropy": 1.0963009595870972, "epoch": 0.96, "grad_norm": 0.13727004826068878, "learning_rate": 4.1202997526578276e-05, "loss": 1.0920417308807373, "mean_token_accuracy": 0.6739914268255234, "num_tokens": 9622724.0, "step": 75 }, { "entropy": 1.0630004107952118, "epoch": 0.9728, "grad_norm": 0.12875896692276, "learning_rate": 4.093559974371725e-05, "loss": 1.0611292123794556, "mean_token_accuracy": 0.6826749593019485, "num_tokens": 9752552.0, "step": 76 }, { "entropy": 1.0773174464702606, "epoch": 0.9856, "grad_norm": 0.13426193594932556, "learning_rate": 4.066509528411152e-05, "loss": 1.0728553533554077, "mean_token_accuracy": 0.6800747960805893, "num_tokens": 9881931.0, "step": 77 }, { "entropy": 1.0630360692739487, "epoch": 0.9984, "grad_norm": 0.15215876698493958, "learning_rate": 4.039153688314145e-05, "loss": 1.0557889938354492, "mean_token_accuracy": 0.6812136247754097, "num_tokens": 10009540.0, "step": 78 }, { "entropy": 1.0610005855560303, "epoch": 1.0, "grad_norm": 0.3391527831554413, "learning_rate": 4.011497787155938e-05, "loss": 1.077329158782959, "mean_token_accuracy": 0.6696272492408752, "num_tokens": 10017540.0, "step": 79 } ], "logging_steps": 1, "max_steps": 237, "num_input_tokens_seen": 0, "num_train_epochs": 3, "save_steps": 500, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 1.057669943367041e+18, "train_batch_size": 1, "trial_name": null, "trial_params": null }