{ "max_steps": 88, "save_steps": 22, "is_world_process_zero": true, "train_batch_size": 1, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "is_hyper_param_search": false, "num_input_tokens_seen": 0, "log_history": [ { "entropy": 0.571594450622797, "epoch": 0.022857142857142857, "grad_norm": 2.03125, "learning_rate": 0.0, "loss": 1.892868161201477, "mean_token_accuracy": 0.6494692210108042, "num_tokens": 28665.0, "step": 1 }, { "entropy": 0.5400022976100445, "epoch": 0.045714285714285714, "grad_norm": 1.953125, "learning_rate": 5e-05, "loss": 1.3431090116500854, "mean_token_accuracy": 0.6841957792639732, "num_tokens": 56298.0, "step": 2 }, { "entropy": 0.5547708570957184, "epoch": 0.06857142857142857, "grad_norm": 2.046875, "learning_rate": 0.0001, "loss": 1.7731074094772339, "mean_token_accuracy": 0.6730335894972086, "num_tokens": 87134.0, "step": 3 }, { "entropy": 0.6138171833008528, "epoch": 0.09142857142857143, "grad_norm": 1.890625, "learning_rate": 0.00015000000000000001, "loss": 1.6849099397659302, "mean_token_accuracy": 0.7163603082299232, "num_tokens": 110491.0, "step": 4 }, { "entropy": 0.713952723890543, "epoch": 0.11428571428571428, "grad_norm": 1.609375, "learning_rate": 0.0002, "loss": 1.6369731426239014, "mean_token_accuracy": 0.6762979347258806, "num_tokens": 138858.0, "step": 5 }, { "entropy": 0.9489956572651863, "epoch": 0.13714285714285715, "grad_norm": 1.609375, "learning_rate": 0.00019993007047883988, "loss": 1.6043992042541504, "mean_token_accuracy": 0.6542574372142553, "num_tokens": 164666.0, "step": 6 }, { "entropy": 1.2052904553711414, "epoch": 0.16, "grad_norm": 2.046875, "learning_rate": 0.00019972037971811802, "loss": 1.1030031442642212, "mean_token_accuracy": 0.7115810438990593, "num_tokens": 198168.0, "step": 7 }, { "entropy": 1.5162354111671448, "epoch": 0.18285714285714286, "grad_norm": 2.609375, "learning_rate": 0.00019937122098932428, "loss": 1.338626503944397, "mean_token_accuracy": 0.7028692364692688, "num_tokens": 229142.0, "step": 8 }, { "entropy": 1.6831717118620872, "epoch": 0.2057142857142857, "grad_norm": 1.203125, "learning_rate": 0.00019888308262251285, "loss": 1.5491583347320557, "mean_token_accuracy": 0.669173551723361, "num_tokens": 257334.0, "step": 9 }, { "entropy": 1.2227612249553204, "epoch": 0.22857142857142856, "grad_norm": 0.6328125, "learning_rate": 0.00019825664732332884, "loss": 1.0137903690338135, "mean_token_accuracy": 0.7204974591732025, "num_tokens": 286904.0, "step": 10 }, { "entropy": 1.1638432145118713, "epoch": 0.25142857142857145, "grad_norm": 0.83984375, "learning_rate": 0.00019749279121818235, "loss": 1.0442439317703247, "mean_token_accuracy": 0.7225705273449421, "num_tokens": 313566.0, "step": 11 }, { "entropy": 1.090791016817093, "epoch": 0.2742857142857143, "grad_norm": 0.75, "learning_rate": 0.00019659258262890683, "loss": 1.2202626466751099, "mean_token_accuracy": 0.6869607474654913, "num_tokens": 343912.0, "step": 12 }, { "entropy": 1.100559327751398, "epoch": 0.29714285714285715, "grad_norm": 0.73046875, "learning_rate": 0.0001955572805786141, "loss": 1.4237300157546997, "mean_token_accuracy": 0.7026770114898682, "num_tokens": 367824.0, "step": 13 }, { "entropy": 1.0772063918411732, "epoch": 0.32, "grad_norm": 0.734375, "learning_rate": 0.00019438833303083678, "loss": 1.3612886667251587, "mean_token_accuracy": 0.7167600486427546, "num_tokens": 397629.0, "step": 14 }, { "entropy": 1.0418964736163616, "epoch": 0.34285714285714286, "grad_norm": 0.76171875, "learning_rate": 0.00019308737486442045, "loss": 1.2377914190292358, "mean_token_accuracy": 0.7337369881570339, "num_tokens": 426172.0, "step": 15 }, { "entropy": 1.02627420052886, "epoch": 0.3657142857142857, "grad_norm": 0.640625, "learning_rate": 0.00019165622558699763, "loss": 1.043224811553955, "mean_token_accuracy": 0.757489874958992, "num_tokens": 455884.0, "step": 16 }, { "entropy": 1.0985115952789783, "epoch": 0.38857142857142857, "grad_norm": 0.75390625, "learning_rate": 0.0001900968867902419, "loss": 1.0292891263961792, "mean_token_accuracy": 0.7834405265748501, "num_tokens": 479943.0, "step": 17 }, { "entropy": 0.9926935620605946, "epoch": 0.4114285714285714, "grad_norm": 0.5234375, "learning_rate": 0.00018841153935046098, "loss": 1.0027269124984741, "mean_token_accuracy": 0.7445859499275684, "num_tokens": 512401.0, "step": 18 }, { "entropy": 1.184921432286501, "epoch": 0.4342857142857143, "grad_norm": 0.6953125, "learning_rate": 0.00018660254037844388, "loss": 0.8860166072845459, "mean_token_accuracy": 0.7711772620677948, "num_tokens": 532314.0, "step": 19 }, { "entropy": 1.0456415861845016, "epoch": 0.45714285714285713, "grad_norm": 0.578125, "learning_rate": 0.00018467241992282843, "loss": 0.821132242679596, "mean_token_accuracy": 0.7591653987765312, "num_tokens": 560611.0, "step": 20 }, { "entropy": 1.0742540583014488, "epoch": 0.48, "grad_norm": 0.6640625, "learning_rate": 0.0001826238774315995, "loss": 1.1304452419281006, "mean_token_accuracy": 0.7381897754967213, "num_tokens": 582239.0, "step": 21 }, { "entropy": 1.0069492012262344, "epoch": 0.5028571428571429, "grad_norm": 0.83203125, "learning_rate": 0.00018045977797666684, "loss": 1.0569063425064087, "mean_token_accuracy": 0.7475782930850983, "num_tokens": 605785.0, "step": 22 }, { "epoch": 0.5028571428571429, "eval_entropy": 1.0555952689051629, "eval_loss": 1.0447686910629272, "eval_mean_token_accuracy": 0.75280682772398, "eval_num_tokens": 605785.0, "eval_runtime": 77.2364, "eval_samples_per_second": 1.295, "eval_steps_per_second": 1.295, "step": 22 }, { "entropy": 1.0209653116762638, "epoch": 0.5257142857142857, "grad_norm": 0.6953125, "learning_rate": 0.000178183148246803, "loss": 0.9215176105499268, "mean_token_accuracy": 0.7393636666238308, "num_tokens": 630668.0, "step": 23 }, { "entropy": 1.1484412215650082, "epoch": 0.5485714285714286, "grad_norm": 0.63671875, "learning_rate": 0.0001757971723145453, "loss": 1.0585880279541016, "mean_token_accuracy": 0.6772188358008862, "num_tokens": 651568.0, "step": 24 }, { "entropy": 1.022590946406126, "epoch": 0.5714285714285714, "grad_norm": 0.6640625, "learning_rate": 0.00017330518718298264, "loss": 0.8019014596939087, "mean_token_accuracy": 0.7844364829361439, "num_tokens": 677010.0, "step": 25 }, { "entropy": 1.1501350328326225, "epoch": 0.5942857142857143, "grad_norm": 0.578125, "learning_rate": 0.00017071067811865476, "loss": 1.1763538122177124, "mean_token_accuracy": 0.7165477126836777, "num_tokens": 699559.0, "step": 26 }, { "entropy": 1.1520305536687374, "epoch": 0.6171428571428571, "grad_norm": 0.84765625, "learning_rate": 0.00016801727377709194, "loss": 1.3568904399871826, "mean_token_accuracy": 0.7278081495314837, "num_tokens": 723860.0, "step": 27 }, { "entropy": 1.1409958936274052, "epoch": 0.64, "grad_norm": 0.73828125, "learning_rate": 0.00016522874112781213, "loss": 1.2788770198822021, "mean_token_accuracy": 0.688488058745861, "num_tokens": 743869.0, "step": 28 }, { "entropy": 1.06721768155694, "epoch": 0.6628571428571428, "grad_norm": 0.796875, "learning_rate": 0.00016234898018587337, "loss": 0.9878795742988586, "mean_token_accuracy": 0.7843082323670387, "num_tokens": 767668.0, "step": 29 }, { "entropy": 0.9738106857985258, "epoch": 0.6857142857142857, "grad_norm": 0.578125, "learning_rate": 0.00015938201855735014, "loss": 0.7424539923667908, "mean_token_accuracy": 0.7907082177698612, "num_tokens": 796481.0, "step": 30 }, { "entropy": 0.9771843180060387, "epoch": 0.7085714285714285, "grad_norm": 0.75, "learning_rate": 0.0001563320058063622, "loss": 0.9626051187515259, "mean_token_accuracy": 0.7523193173110485, "num_tokens": 829764.0, "step": 31 }, { "entropy": 1.151510078459978, "epoch": 0.7314285714285714, "grad_norm": 0.78125, "learning_rate": 0.00015320320765153367, "loss": 1.270058512687683, "mean_token_accuracy": 0.6807492543011904, "num_tokens": 855562.0, "step": 32 }, { "entropy": 0.9595269281417131, "epoch": 0.7542857142857143, "grad_norm": 0.5625, "learning_rate": 0.00015000000000000001, "loss": 0.9262505173683167, "mean_token_accuracy": 0.7448003850877285, "num_tokens": 886448.0, "step": 33 }, { "entropy": 0.9837835170328617, "epoch": 0.7771428571428571, "grad_norm": 0.82421875, "learning_rate": 0.0001467268628273062, "loss": 0.7896201014518738, "mean_token_accuracy": 0.7692355290055275, "num_tokens": 909179.0, "step": 34 }, { "entropy": 1.0101780369877815, "epoch": 0.8, "grad_norm": 0.9375, "learning_rate": 0.00014338837391175582, "loss": 1.1079224348068237, "mean_token_accuracy": 0.743992704898119, "num_tokens": 932293.0, "step": 35 }, { "entropy": 1.124088928103447, "epoch": 0.8228571428571428, "grad_norm": 0.84375, "learning_rate": 0.00013998920243197407, "loss": 1.2773886919021606, "mean_token_accuracy": 0.7306922785937786, "num_tokens": 953785.0, "step": 36 }, { "entropy": 1.0273678377270699, "epoch": 0.8457142857142858, "grad_norm": 0.765625, "learning_rate": 0.00013653410243663952, "loss": 1.0014641284942627, "mean_token_accuracy": 0.7343494817614555, "num_tokens": 983541.0, "step": 37 }, { "entropy": 1.1427535712718964, "epoch": 0.8685714285714285, "grad_norm": 0.671875, "learning_rate": 0.00013302790619551674, "loss": 1.1199904680252075, "mean_token_accuracy": 0.7464530095458031, "num_tokens": 1009431.0, "step": 38 }, { "entropy": 1.1668125055730343, "epoch": 0.8914285714285715, "grad_norm": 0.6015625, "learning_rate": 0.00012947551744109043, "loss": 0.9645350575447083, "mean_token_accuracy": 0.780300073325634, "num_tokens": 1027701.0, "step": 39 }, { "entropy": 1.1839856766164303, "epoch": 0.9142857142857143, "grad_norm": 0.62109375, "learning_rate": 0.00012588190451025207, "loss": 1.2035199403762817, "mean_token_accuracy": 0.7434030883014202, "num_tokens": 1055642.0, "step": 40 }, { "entropy": 1.103015311062336, "epoch": 0.9371428571428572, "grad_norm": 0.62109375, "learning_rate": 0.00012225209339563145, "loss": 1.0058553218841553, "mean_token_accuracy": 0.7543482556939125, "num_tokens": 1084745.0, "step": 41 }, { "entropy": 1.1135993152856827, "epoch": 0.96, "grad_norm": 0.6953125, "learning_rate": 0.00011859116071629149, "loss": 1.2151912450790405, "mean_token_accuracy": 0.7335421219468117, "num_tokens": 1110320.0, "step": 42 }, { "entropy": 1.1436597369611263, "epoch": 0.9828571428571429, "grad_norm": 0.58203125, "learning_rate": 0.00011490422661761744, "loss": 1.0186842679977417, "mean_token_accuracy": 0.7390037253499031, "num_tokens": 1134964.0, "step": 43 }, { "entropy": 1.078730583190918, "epoch": 1.0, "grad_norm": 0.65625, "learning_rate": 0.00011119644761033078, "loss": 0.8101186752319336, "mean_token_accuracy": 0.7597745011250178, "num_tokens": 1153583.0, "step": 44 }, { "epoch": 1.0, "eval_entropy": 1.0479114320874214, "eval_loss": 0.9729008674621582, "eval_mean_token_accuracy": 0.7565665817260743, "eval_num_tokens": 1153583.0, "eval_runtime": 77.2335, "eval_samples_per_second": 1.295, "eval_steps_per_second": 1.295, "step": 44 }, { "entropy": 1.0368036814033985, "epoch": 1.022857142857143, "grad_norm": 0.56640625, "learning_rate": 0.00010747300935864243, "loss": 0.8468512296676636, "mean_token_accuracy": 0.8111352436244488, "num_tokens": 1174609.0, "step": 45 }, { "entropy": 0.9628574140369892, "epoch": 1.0457142857142858, "grad_norm": 0.5546875, "learning_rate": 0.0001037391194276326, "loss": 0.5208293199539185, "mean_token_accuracy": 0.8187313564121723, "num_tokens": 1201897.0, "step": 46 }, { "entropy": 1.0299121290445328, "epoch": 1.0685714285714285, "grad_norm": 0.765625, "learning_rate": 0.0001, "loss": 0.7912545204162598, "mean_token_accuracy": 0.7928437106311321, "num_tokens": 1230046.0, "step": 47 }, { "entropy": 1.0342555530369282, "epoch": 1.0914285714285714, "grad_norm": 0.74609375, "learning_rate": 9.626088057236745e-05, "loss": 0.9557701349258423, "mean_token_accuracy": 0.7545025758445263, "num_tokens": 1257406.0, "step": 48 }, { "entropy": 0.9161418825387955, "epoch": 1.1142857142857143, "grad_norm": 0.7109375, "learning_rate": 9.252699064135758e-05, "loss": 1.0390901565551758, "mean_token_accuracy": 0.7715597599744797, "num_tokens": 1291055.0, "step": 49 }, { "entropy": 0.8812923058867455, "epoch": 1.1371428571428572, "grad_norm": 0.625, "learning_rate": 8.880355238966923e-05, "loss": 0.6828033328056335, "mean_token_accuracy": 0.8140444047749043, "num_tokens": 1318257.0, "step": 50 }, { "entropy": 1.0039622746407986, "epoch": 1.16, "grad_norm": 0.546875, "learning_rate": 8.509577338238255e-05, "loss": 0.7247803807258606, "mean_token_accuracy": 0.7645618040114641, "num_tokens": 1341106.0, "step": 51 }, { "entropy": 0.905966442078352, "epoch": 1.1828571428571428, "grad_norm": 0.5625, "learning_rate": 8.140883928370855e-05, "loss": 0.7403977513313293, "mean_token_accuracy": 0.8016074895858765, "num_tokens": 1369760.0, "step": 52 }, { "entropy": 0.9338806178420782, "epoch": 1.2057142857142857, "grad_norm": 0.490234375, "learning_rate": 7.774790660436858e-05, "loss": 0.6406869888305664, "mean_token_accuracy": 0.7956290915608406, "num_tokens": 1392567.0, "step": 53 }, { "entropy": 0.8846337422728539, "epoch": 1.2285714285714286, "grad_norm": 0.69921875, "learning_rate": 7.411809548974792e-05, "loss": 0.8057032823562622, "mean_token_accuracy": 0.7973924726247787, "num_tokens": 1419324.0, "step": 54 }, { "entropy": 0.9206812232732773, "epoch": 1.2514285714285713, "grad_norm": 0.8125, "learning_rate": 7.052448255890957e-05, "loss": 0.6728847026824951, "mean_token_accuracy": 0.8473470285534859, "num_tokens": 1446756.0, "step": 55 }, { "entropy": 0.9307001233100891, "epoch": 1.2742857142857142, "grad_norm": 0.8515625, "learning_rate": 6.697209380448333e-05, "loss": 0.7187720537185669, "mean_token_accuracy": 0.8393540307879448, "num_tokens": 1468062.0, "step": 56 }, { "entropy": 0.8503624759614468, "epoch": 1.2971428571428572, "grad_norm": 0.64453125, "learning_rate": 6.34658975633605e-05, "loss": 0.6491850018501282, "mean_token_accuracy": 0.834420669823885, "num_tokens": 1497763.0, "step": 57 }, { "entropy": 0.8430384919047356, "epoch": 1.32, "grad_norm": 0.62890625, "learning_rate": 6.001079756802592e-05, "loss": 0.7592802047729492, "mean_token_accuracy": 0.7834662459790707, "num_tokens": 1523103.0, "step": 58 }, { "entropy": 1.0481715574860573, "epoch": 1.342857142857143, "grad_norm": 1.15625, "learning_rate": 5.6611626088244194e-05, "loss": 0.8737943768501282, "mean_token_accuracy": 0.7567208111286163, "num_tokens": 1540582.0, "step": 59 }, { "entropy": 0.849721547216177, "epoch": 1.3657142857142857, "grad_norm": 0.8984375, "learning_rate": 5.32731371726938e-05, "loss": 0.7518897652626038, "mean_token_accuracy": 0.8164225146174431, "num_tokens": 1562096.0, "step": 60 }, { "entropy": 0.7319265194237232, "epoch": 1.3885714285714286, "grad_norm": 0.76953125, "learning_rate": 5.000000000000002e-05, "loss": 0.5088726282119751, "mean_token_accuracy": 0.8368714712560177, "num_tokens": 1588869.0, "step": 61 }, { "entropy": 0.7714136429131031, "epoch": 1.4114285714285715, "grad_norm": 0.515625, "learning_rate": 4.6796792348466356e-05, "loss": 0.5990605354309082, "mean_token_accuracy": 0.8109956867992878, "num_tokens": 1618753.0, "step": 62 }, { "entropy": 0.8922704569995403, "epoch": 1.4342857142857142, "grad_norm": 0.7265625, "learning_rate": 4.3667994193637796e-05, "loss": 0.7471989393234253, "mean_token_accuracy": 0.8137485198676586, "num_tokens": 1639035.0, "step": 63 }, { "entropy": 0.8474112637341022, "epoch": 1.457142857142857, "grad_norm": 0.9375, "learning_rate": 4.0617981442649855e-05, "loss": 0.9250304102897644, "mean_token_accuracy": 0.7889886423945427, "num_tokens": 1667695.0, "step": 64 }, { "entropy": 0.8302664868533611, "epoch": 1.48, "grad_norm": 0.8984375, "learning_rate": 3.7651019814126654e-05, "loss": 0.9558159112930298, "mean_token_accuracy": 0.7763096019625664, "num_tokens": 1691022.0, "step": 65 }, { "entropy": 0.8031172640621662, "epoch": 1.502857142857143, "grad_norm": 0.79296875, "learning_rate": 3.477125887218792e-05, "loss": 0.801313042640686, "mean_token_accuracy": 0.8177301362156868, "num_tokens": 1724435.0, "step": 66 }, { "epoch": 1.502857142857143, "eval_entropy": 0.8457768812775612, "eval_loss": 0.9875430464744568, "eval_mean_token_accuracy": 0.756916128396988, "eval_num_tokens": 1724435.0, "eval_runtime": 77.2316, "eval_samples_per_second": 1.295, "eval_steps_per_second": 1.295, "step": 66 }, { "entropy": 0.841597568243742, "epoch": 1.5257142857142858, "grad_norm": 0.8359375, "learning_rate": 3.198272622290804e-05, "loss": 0.8447511196136475, "mean_token_accuracy": 0.7982683703303337, "num_tokens": 1752489.0, "step": 67 }, { "entropy": 0.873002614825964, "epoch": 1.5485714285714285, "grad_norm": 0.68359375, "learning_rate": 2.9289321881345254e-05, "loss": 0.8038796782493591, "mean_token_accuracy": 0.8067350275814533, "num_tokens": 1784291.0, "step": 68 }, { "entropy": 0.9177370071411133, "epoch": 1.5714285714285714, "grad_norm": 0.6796875, "learning_rate": 2.669481281701739e-05, "loss": 0.8557254672050476, "mean_token_accuracy": 0.8137136548757553, "num_tokens": 1804179.0, "step": 69 }, { "entropy": 0.8276135660707951, "epoch": 1.5942857142857143, "grad_norm": 0.73828125, "learning_rate": 2.420282768545469e-05, "loss": 0.6800186634063721, "mean_token_accuracy": 0.8346021547913551, "num_tokens": 1831612.0, "step": 70 }, { "entropy": 0.9364416636526585, "epoch": 1.617142857142857, "grad_norm": 0.75390625, "learning_rate": 2.181685175319702e-05, "loss": 0.7834956049919128, "mean_token_accuracy": 0.7997728437185287, "num_tokens": 1853595.0, "step": 71 }, { "entropy": 0.8710121884942055, "epoch": 1.6400000000000001, "grad_norm": 0.765625, "learning_rate": 1.9540222023333166e-05, "loss": 0.6057661771774292, "mean_token_accuracy": 0.8205794207751751, "num_tokens": 1882408.0, "step": 72 }, { "entropy": 0.8379442691802979, "epoch": 1.6628571428571428, "grad_norm": 0.7734375, "learning_rate": 1.7376122568400532e-05, "loss": 0.7106757760047913, "mean_token_accuracy": 0.8180459216237068, "num_tokens": 1904944.0, "step": 73 }, { "entropy": 0.8745108097791672, "epoch": 1.6857142857142857, "grad_norm": 1.2109375, "learning_rate": 1.5327580077171587e-05, "loss": 0.9369223713874817, "mean_token_accuracy": 0.8044208958745003, "num_tokens": 1933402.0, "step": 74 }, { "entropy": 0.8298410475254059, "epoch": 1.7085714285714286, "grad_norm": 0.8828125, "learning_rate": 1.339745962155613e-05, "loss": 0.6346684694290161, "mean_token_accuracy": 0.8335375674068928, "num_tokens": 1960093.0, "step": 75 }, { "entropy": 0.8175692446529865, "epoch": 1.7314285714285713, "grad_norm": 0.91796875, "learning_rate": 1.1588460649539035e-05, "loss": 0.9119294285774231, "mean_token_accuracy": 0.8193050436675549, "num_tokens": 1986339.0, "step": 76 }, { "entropy": 0.8975704163312912, "epoch": 1.7542857142857144, "grad_norm": 0.859375, "learning_rate": 9.903113209758096e-06, "loss": 0.7237526178359985, "mean_token_accuracy": 0.7882252000272274, "num_tokens": 2011176.0, "step": 77 }, { "entropy": 0.8363670147955418, "epoch": 1.7771428571428571, "grad_norm": 0.74609375, "learning_rate": 8.343774413002381e-06, "loss": 0.6269868016242981, "mean_token_accuracy": 0.8103100657463074, "num_tokens": 2041289.0, "step": 78 }, { "entropy": 0.8557109721004963, "epoch": 1.8, "grad_norm": 0.6171875, "learning_rate": 6.9126251355795864e-06, "loss": 0.5580326914787292, "mean_token_accuracy": 0.8539069853723049, "num_tokens": 2069418.0, "step": 79 }, { "entropy": 0.790475644171238, "epoch": 1.822857142857143, "grad_norm": 0.984375, "learning_rate": 5.611666969163243e-06, "loss": 0.6902757287025452, "mean_token_accuracy": 0.8313734903931618, "num_tokens": 2101162.0, "step": 80 }, { "entropy": 0.8487820513546467, "epoch": 1.8457142857142856, "grad_norm": 0.7265625, "learning_rate": 4.442719421385922e-06, "loss": 0.6248161792755127, "mean_token_accuracy": 0.8196811378002167, "num_tokens": 2129262.0, "step": 81 }, { "entropy": 0.8948404788970947, "epoch": 1.8685714285714285, "grad_norm": 0.87890625, "learning_rate": 3.40741737109318e-06, "loss": 0.8848119378089905, "mean_token_accuracy": 0.7821721211075783, "num_tokens": 2152597.0, "step": 82 }, { "entropy": 0.9239097908139229, "epoch": 1.8914285714285715, "grad_norm": 0.7421875, "learning_rate": 2.5072087818176382e-06, "loss": 0.7065685987472534, "mean_token_accuracy": 0.807807132601738, "num_tokens": 2177161.0, "step": 83 }, { "entropy": 0.7839450426399708, "epoch": 1.9142857142857141, "grad_norm": 0.77734375, "learning_rate": 1.7433526766711728e-06, "loss": 0.7359437942504883, "mean_token_accuracy": 0.8403091952204704, "num_tokens": 2209858.0, "step": 84 }, { "entropy": 0.843034666031599, "epoch": 1.9371428571428573, "grad_norm": 0.765625, "learning_rate": 1.1169173774871478e-06, "loss": 0.7045976519584656, "mean_token_accuracy": 0.7968335002660751, "num_tokens": 2238762.0, "step": 85 }, { "entropy": 0.8172502107918262, "epoch": 1.96, "grad_norm": 0.73046875, "learning_rate": 6.287790106757396e-07, "loss": 0.7153176665306091, "mean_token_accuracy": 0.8268864750862122, "num_tokens": 2266000.0, "step": 86 }, { "entropy": 0.9393381252884865, "epoch": 1.9828571428571429, "grad_norm": 0.8046875, "learning_rate": 2.7962028188198706e-07, "loss": 0.7222880721092224, "mean_token_accuracy": 0.8043639399111271, "num_tokens": 2291896.0, "step": 87 }, { "entropy": 0.9007064700126648, "epoch": 2.0, "grad_norm": 0.9453125, "learning_rate": 6.992952116013918e-08, "loss": 0.9412174224853516, "mean_token_accuracy": 0.7673612783352534, "num_tokens": 2307166.0, "step": 88 }, { "epoch": 2.0, "eval_entropy": 0.8574838742613793, "eval_loss": 0.9815174341201782, "eval_mean_token_accuracy": 0.7545835164189338, "eval_num_tokens": 2307166.0, "eval_runtime": 77.2359, "eval_samples_per_second": 1.295, "eval_steps_per_second": 1.295, "step": 88 }, { "epoch": 2.0, "step": 88, "total_flos": 1.0597781694661018e+17, "train_loss": 0.9580497294664383, "train_runtime": 4168.6102, "train_samples_per_second": 0.336, "train_steps_per_second": 0.021 } ], "trial_params": null, "global_step": 88, "is_local_process_zero": true, "total_flos": 1.0597781694661018e+17, "num_train_epochs": 2, "epoch": 2.0, "best_metric": null, "trial_name": null }