{ "best_global_step": 520, "best_metric": 1.7184369564056396, "best_model_checkpoint": "/kaggle/working/exp_a/checkpoint-520", "epoch": 5.0, "eval_steps": 500, "global_step": 520, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "entropy": 2.5125404238700866, "epoch": 0.04819277108433735, "grad_norm": 3.107343912124634, "learning_rate": 8e-05, "loss": 3.331409454345703, "mean_token_accuracy": 0.4246453382074833, "num_tokens": 3544.0, "step": 5 }, { "entropy": 2.473379173874855, "epoch": 0.0963855421686747, "grad_norm": 4.13798189163208, "learning_rate": 0.00018, "loss": 3.170204734802246, "mean_token_accuracy": 0.44643297120928765, "num_tokens": 6921.0, "step": 10 }, { "entropy": 2.7136070847511293, "epoch": 0.14457831325301204, "grad_norm": 1.889716625213623, "learning_rate": 0.00019843137254901963, "loss": 2.8694551467895506, "mean_token_accuracy": 0.4593485899269581, "num_tokens": 9897.0, "step": 15 }, { "entropy": 2.638975989818573, "epoch": 0.1927710843373494, "grad_norm": 1.5089645385742188, "learning_rate": 0.00019647058823529413, "loss": 2.4013465881347655, "mean_token_accuracy": 0.5249107554554939, "num_tokens": 13386.0, "step": 20 }, { "entropy": 2.554114228487015, "epoch": 0.24096385542168675, "grad_norm": 1.3503361940383911, "learning_rate": 0.00019450980392156863, "loss": 2.3163000106811524, "mean_token_accuracy": 0.56058479398489, "num_tokens": 16770.0, "step": 25 }, { "entropy": 2.2394246786832808, "epoch": 0.2891566265060241, "grad_norm": 1.2784709930419922, "learning_rate": 0.00019254901960784316, "loss": 2.078316879272461, "mean_token_accuracy": 0.5896236382424831, "num_tokens": 19815.0, "step": 30 }, { "entropy": 2.1424703538417815, "epoch": 0.3373493975903614, "grad_norm": 2.2359020709991455, "learning_rate": 0.00019058823529411766, "loss": 2.087246894836426, "mean_token_accuracy": 0.5787902362644672, "num_tokens": 22956.0, "step": 35 }, { "entropy": 2.093654748797417, "epoch": 0.3855421686746988, "grad_norm": 2.349356174468994, "learning_rate": 0.00018862745098039216, "loss": 2.0384281158447264, "mean_token_accuracy": 0.5887037836015224, "num_tokens": 26147.0, "step": 40 }, { "entropy": 2.0577339619398116, "epoch": 0.43373493975903615, "grad_norm": 1.649864912033081, "learning_rate": 0.0001866666666666667, "loss": 2.0328414916992186, "mean_token_accuracy": 0.602185083180666, "num_tokens": 29290.0, "step": 45 }, { "entropy": 2.033597409725189, "epoch": 0.4819277108433735, "grad_norm": 1.2588778734207153, "learning_rate": 0.0001847058823529412, "loss": 2.0368608474731444, "mean_token_accuracy": 0.5883708715438842, "num_tokens": 32774.0, "step": 50 }, { "entropy": 1.9881025731563569, "epoch": 0.5301204819277109, "grad_norm": 1.3411701917648315, "learning_rate": 0.0001827450980392157, "loss": 1.946812629699707, "mean_token_accuracy": 0.5845362402498722, "num_tokens": 36361.0, "step": 55 }, { "entropy": 1.974584263563156, "epoch": 0.5783132530120482, "grad_norm": 2.2939326763153076, "learning_rate": 0.00018078431372549022, "loss": 2.0149436950683595, "mean_token_accuracy": 0.5910582594573498, "num_tokens": 39883.0, "step": 60 }, { "entropy": 1.892711740732193, "epoch": 0.6265060240963856, "grad_norm": 2.040877342224121, "learning_rate": 0.00017882352941176472, "loss": 1.8759027481079102, "mean_token_accuracy": 0.617172273248434, "num_tokens": 43257.0, "step": 65 }, { "entropy": 1.921028771996498, "epoch": 0.6746987951807228, "grad_norm": 1.2713969945907593, "learning_rate": 0.00017686274509803922, "loss": 1.8866106033325196, "mean_token_accuracy": 0.6131292454898357, "num_tokens": 46204.0, "step": 70 }, { "entropy": 1.8816440194845199, "epoch": 0.7228915662650602, "grad_norm": 1.4800573587417603, "learning_rate": 0.00017490196078431375, "loss": 1.9057266235351562, "mean_token_accuracy": 0.5993098318576813, "num_tokens": 49793.0, "step": 75 }, { "entropy": 1.8062270611524582, "epoch": 0.7710843373493976, "grad_norm": 2.195326566696167, "learning_rate": 0.00017294117647058825, "loss": 1.8263084411621093, "mean_token_accuracy": 0.6268978863954544, "num_tokens": 53104.0, "step": 80 }, { "entropy": 1.7734803646802901, "epoch": 0.8192771084337349, "grad_norm": 1.90998375415802, "learning_rate": 0.00017098039215686275, "loss": 1.7766584396362304, "mean_token_accuracy": 0.6333199128508568, "num_tokens": 56062.0, "step": 85 }, { "entropy": 1.8309715777635573, "epoch": 0.8674698795180723, "grad_norm": 1.3006683588027954, "learning_rate": 0.00016901960784313725, "loss": 1.857182502746582, "mean_token_accuracy": 0.6287190951406956, "num_tokens": 59161.0, "step": 90 }, { "entropy": 1.8734614104032516, "epoch": 0.9156626506024096, "grad_norm": 1.5136709213256836, "learning_rate": 0.00016705882352941178, "loss": 1.8590967178344726, "mean_token_accuracy": 0.6196285620331764, "num_tokens": 62426.0, "step": 95 }, { "entropy": 1.7397653341293335, "epoch": 0.963855421686747, "grad_norm": 1.647998571395874, "learning_rate": 0.00016509803921568628, "loss": 1.7337995529174806, "mean_token_accuracy": 0.6293763548135758, "num_tokens": 65573.0, "step": 100 }, { "epoch": 1.0, "eval_entropy": 1.8366776154591486, "eval_loss": 1.8674575090408325, "eval_mean_token_accuracy": 0.5964838358072134, "eval_num_tokens": 68001.0, "eval_runtime": 14.8665, "eval_samples_per_second": 13.991, "eval_steps_per_second": 1.749, "step": 104 }, { "entropy": 1.7183971075635207, "epoch": 1.0096385542168675, "grad_norm": 2.0711727142333984, "learning_rate": 0.00016313725490196078, "loss": 1.7683034896850587, "mean_token_accuracy": 0.6259415377127496, "num_tokens": 68613.0, "step": 105 }, { "entropy": 1.8635606437921524, "epoch": 1.0578313253012048, "grad_norm": 1.2785375118255615, "learning_rate": 0.0001611764705882353, "loss": 1.8564044952392578, "mean_token_accuracy": 0.6166318386793137, "num_tokens": 72379.0, "step": 110 }, { "entropy": 1.8101747632026672, "epoch": 1.106024096385542, "grad_norm": 1.634289264678955, "learning_rate": 0.0001592156862745098, "loss": 1.8175914764404297, "mean_token_accuracy": 0.6229961954057217, "num_tokens": 75330.0, "step": 115 }, { "entropy": 1.7687339812517167, "epoch": 1.1542168674698796, "grad_norm": 1.4806301593780518, "learning_rate": 0.0001572549019607843, "loss": 1.7809358596801759, "mean_token_accuracy": 0.6301124401390552, "num_tokens": 78552.0, "step": 120 }, { "entropy": 1.7583049044013024, "epoch": 1.202409638554217, "grad_norm": 1.6424956321716309, "learning_rate": 0.00015529411764705884, "loss": 1.744133186340332, "mean_token_accuracy": 0.6302636325359344, "num_tokens": 81798.0, "step": 125 }, { "entropy": 1.6877357229590415, "epoch": 1.2506024096385542, "grad_norm": 1.5315968990325928, "learning_rate": 0.00015333333333333334, "loss": 1.637476348876953, "mean_token_accuracy": 0.650700282305479, "num_tokens": 85117.0, "step": 130 }, { "entropy": 1.7318841934204101, "epoch": 1.2987951807228915, "grad_norm": 1.4535908699035645, "learning_rate": 0.00015137254901960784, "loss": 1.7752351760864258, "mean_token_accuracy": 0.6226705864071846, "num_tokens": 88742.0, "step": 135 }, { "entropy": 1.7382851645350457, "epoch": 1.346987951807229, "grad_norm": 1.5624728202819824, "learning_rate": 0.00014941176470588237, "loss": 1.7821353912353515, "mean_token_accuracy": 0.6388084962964058, "num_tokens": 92210.0, "step": 140 }, { "entropy": 1.657819251716137, "epoch": 1.3951807228915662, "grad_norm": 1.827693223953247, "learning_rate": 0.00014745098039215687, "loss": 1.620370864868164, "mean_token_accuracy": 0.6545050926506519, "num_tokens": 95303.0, "step": 145 }, { "entropy": 1.6616802349686624, "epoch": 1.4433734939759035, "grad_norm": 1.8607943058013916, "learning_rate": 0.00014549019607843137, "loss": 1.5599291801452637, "mean_token_accuracy": 0.6593139126896859, "num_tokens": 98384.0, "step": 150 }, { "entropy": 1.5860232621431352, "epoch": 1.491566265060241, "grad_norm": 1.9932466745376587, "learning_rate": 0.0001435294117647059, "loss": 1.6419692993164063, "mean_token_accuracy": 0.6570444725453853, "num_tokens": 101490.0, "step": 155 }, { "entropy": 1.551141259074211, "epoch": 1.5397590361445783, "grad_norm": 2.086176872253418, "learning_rate": 0.0001415686274509804, "loss": 1.5585495948791503, "mean_token_accuracy": 0.6683049827814103, "num_tokens": 104191.0, "step": 160 }, { "entropy": 1.6165375381708145, "epoch": 1.5879518072289156, "grad_norm": 1.7320177555084229, "learning_rate": 0.0001396078431372549, "loss": 1.6773378372192382, "mean_token_accuracy": 0.6502716824412346, "num_tokens": 107261.0, "step": 165 }, { "entropy": 1.704845277965069, "epoch": 1.636144578313253, "grad_norm": 1.967751383781433, "learning_rate": 0.00013764705882352943, "loss": 1.7607194900512695, "mean_token_accuracy": 0.6385575778782367, "num_tokens": 110608.0, "step": 170 }, { "entropy": 1.6652135044336318, "epoch": 1.6843373493975904, "grad_norm": 1.616722822189331, "learning_rate": 0.00013568627450980393, "loss": 1.6635320663452149, "mean_token_accuracy": 0.6614525228738785, "num_tokens": 113881.0, "step": 175 }, { "entropy": 1.6908259093761444, "epoch": 1.7325301204819277, "grad_norm": 1.711729645729065, "learning_rate": 0.00013372549019607843, "loss": 1.6920236587524413, "mean_token_accuracy": 0.6418330393731594, "num_tokens": 117044.0, "step": 180 }, { "entropy": 1.7484796479344369, "epoch": 1.7807228915662652, "grad_norm": 1.5955023765563965, "learning_rate": 0.00013176470588235296, "loss": 1.717266845703125, "mean_token_accuracy": 0.6351907752454281, "num_tokens": 120606.0, "step": 185 }, { "entropy": 1.6216741874814034, "epoch": 1.8289156626506025, "grad_norm": 1.622183084487915, "learning_rate": 0.00012980392156862746, "loss": 1.674321174621582, "mean_token_accuracy": 0.6502599447965622, "num_tokens": 123899.0, "step": 190 }, { "entropy": 1.6669133231043816, "epoch": 1.8771084337349397, "grad_norm": 1.867492914199829, "learning_rate": 0.00012784313725490196, "loss": 1.7255191802978516, "mean_token_accuracy": 0.6400439321994782, "num_tokens": 127473.0, "step": 195 }, { "entropy": 1.675342607498169, "epoch": 1.9253012048192772, "grad_norm": 1.855635166168213, "learning_rate": 0.0001258823529411765, "loss": 1.7129255294799806, "mean_token_accuracy": 0.62674540579319, "num_tokens": 130771.0, "step": 200 }, { "entropy": 1.6791207402944566, "epoch": 1.9734939759036143, "grad_norm": 1.7303972244262695, "learning_rate": 0.000123921568627451, "loss": 1.7065092086791993, "mean_token_accuracy": 0.6443807639181613, "num_tokens": 134125.0, "step": 205 }, { "epoch": 2.0, "eval_entropy": 1.8138972566677973, "eval_loss": 1.7650498151779175, "eval_mean_token_accuracy": 0.6141013021652515, "eval_num_tokens": 136002.0, "eval_runtime": 14.8533, "eval_samples_per_second": 14.004, "eval_steps_per_second": 1.75, "step": 208 }, { "entropy": 1.6970797196814889, "epoch": 2.019277108433735, "grad_norm": 1.7416448593139648, "learning_rate": 0.0001219607843137255, "loss": 1.692988395690918, "mean_token_accuracy": 0.6389423718577937, "num_tokens": 137377.0, "step": 210 }, { "entropy": 1.7040952891111374, "epoch": 2.067469879518072, "grad_norm": 1.8894716501235962, "learning_rate": 0.00012, "loss": 1.6213483810424805, "mean_token_accuracy": 0.6468638084828854, "num_tokens": 141109.0, "step": 215 }, { "entropy": 1.5890287652611732, "epoch": 2.1156626506024097, "grad_norm": 2.304762601852417, "learning_rate": 0.00011803921568627452, "loss": 1.5466879844665526, "mean_token_accuracy": 0.6704243734478951, "num_tokens": 144100.0, "step": 220 }, { "entropy": 1.6182831943035125, "epoch": 2.163855421686747, "grad_norm": 1.9651720523834229, "learning_rate": 0.00011607843137254903, "loss": 1.6720081329345704, "mean_token_accuracy": 0.65214222073555, "num_tokens": 147584.0, "step": 225 }, { "entropy": 1.5671581000089645, "epoch": 2.212048192771084, "grad_norm": 1.9738132953643799, "learning_rate": 0.00011411764705882353, "loss": 1.647587203979492, "mean_token_accuracy": 0.6729991242289544, "num_tokens": 150511.0, "step": 230 }, { "entropy": 1.6577306151390077, "epoch": 2.2602409638554217, "grad_norm": 1.8251382112503052, "learning_rate": 0.00011215686274509805, "loss": 1.5790367126464844, "mean_token_accuracy": 0.6663866609334945, "num_tokens": 154053.0, "step": 235 }, { "entropy": 1.5505558550357819, "epoch": 2.3084337349397592, "grad_norm": 2.1022140979766846, "learning_rate": 0.00011019607843137256, "loss": 1.588535976409912, "mean_token_accuracy": 0.6634533762931824, "num_tokens": 157138.0, "step": 240 }, { "entropy": 1.5530098304152489, "epoch": 2.3566265060240963, "grad_norm": 2.045732259750366, "learning_rate": 0.00010823529411764706, "loss": 1.5270882606506349, "mean_token_accuracy": 0.6741401948034763, "num_tokens": 160436.0, "step": 245 }, { "entropy": 1.596367821097374, "epoch": 2.404819277108434, "grad_norm": 1.6421279907226562, "learning_rate": 0.00010627450980392158, "loss": 1.56561279296875, "mean_token_accuracy": 0.6635179311037064, "num_tokens": 163761.0, "step": 250 }, { "entropy": 1.6159405663609505, "epoch": 2.453012048192771, "grad_norm": 1.8586058616638184, "learning_rate": 0.00010431372549019609, "loss": 1.5304578781127929, "mean_token_accuracy": 0.6609816014766693, "num_tokens": 166898.0, "step": 255 }, { "entropy": 1.5298877507448196, "epoch": 2.5012048192771084, "grad_norm": 2.2185778617858887, "learning_rate": 0.00010235294117647058, "loss": 1.552015781402588, "mean_token_accuracy": 0.6700602419674396, "num_tokens": 169909.0, "step": 260 }, { "entropy": 1.6168403923511505, "epoch": 2.549397590361446, "grad_norm": 1.8064223527908325, "learning_rate": 0.00010039215686274511, "loss": 1.5809405326843262, "mean_token_accuracy": 0.6531007468700409, "num_tokens": 173365.0, "step": 265 }, { "entropy": 1.6430342257022859, "epoch": 2.597590361445783, "grad_norm": 2.219008684158325, "learning_rate": 9.843137254901961e-05, "loss": 1.661992073059082, "mean_token_accuracy": 0.6535247735679149, "num_tokens": 176834.0, "step": 270 }, { "entropy": 1.5823266848921775, "epoch": 2.6457831325301204, "grad_norm": 1.9590431451797485, "learning_rate": 9.647058823529412e-05, "loss": 1.515106773376465, "mean_token_accuracy": 0.6696497216820717, "num_tokens": 180153.0, "step": 275 }, { "entropy": 1.6698341622948647, "epoch": 2.693975903614458, "grad_norm": 1.6002068519592285, "learning_rate": 9.450980392156862e-05, "loss": 1.6272111892700196, "mean_token_accuracy": 0.6547548659145832, "num_tokens": 183512.0, "step": 280 }, { "entropy": 1.5231620341539382, "epoch": 2.742168674698795, "grad_norm": 1.950395941734314, "learning_rate": 9.254901960784315e-05, "loss": 1.5006098747253418, "mean_token_accuracy": 0.679551114141941, "num_tokens": 186472.0, "step": 285 }, { "entropy": 1.4535922273993491, "epoch": 2.7903614457831325, "grad_norm": 2.09175705909729, "learning_rate": 9.058823529411765e-05, "loss": 1.467922306060791, "mean_token_accuracy": 0.695755822956562, "num_tokens": 189517.0, "step": 290 }, { "entropy": 1.5150477439165115, "epoch": 2.83855421686747, "grad_norm": 2.532780170440674, "learning_rate": 8.862745098039215e-05, "loss": 1.5379227638244628, "mean_token_accuracy": 0.6792982123792172, "num_tokens": 192652.0, "step": 295 }, { "entropy": 1.5019459277391434, "epoch": 2.886746987951807, "grad_norm": 2.0246798992156982, "learning_rate": 8.666666666666667e-05, "loss": 1.5374203681945802, "mean_token_accuracy": 0.6916215568780899, "num_tokens": 195757.0, "step": 300 }, { "entropy": 1.480114082992077, "epoch": 2.9349397590361446, "grad_norm": 1.8221111297607422, "learning_rate": 8.470588235294118e-05, "loss": 1.4599919319152832, "mean_token_accuracy": 0.6793610081076622, "num_tokens": 198807.0, "step": 305 }, { "entropy": 1.5545434340834619, "epoch": 2.983132530120482, "grad_norm": 1.9728882312774658, "learning_rate": 8.274509803921568e-05, "loss": 1.5928434371948241, "mean_token_accuracy": 0.6610011547803879, "num_tokens": 202500.0, "step": 310 }, { "epoch": 3.0, "eval_entropy": 1.6712642128650959, "eval_loss": 1.735916256904602, "eval_mean_token_accuracy": 0.6211101160599635, "eval_num_tokens": 204003.0, "eval_runtime": 14.8568, "eval_samples_per_second": 14.0, "eval_steps_per_second": 1.75, "step": 312 }, { "entropy": 1.5852490004740263, "epoch": 3.0289156626506024, "grad_norm": 2.1537606716156006, "learning_rate": 8.07843137254902e-05, "loss": 1.5842859268188476, "mean_token_accuracy": 0.6565342867060712, "num_tokens": 205682.0, "step": 315 }, { "entropy": 1.5908529162406921, "epoch": 3.07710843373494, "grad_norm": 2.137528657913208, "learning_rate": 7.882352941176471e-05, "loss": 1.5232861518859864, "mean_token_accuracy": 0.6684555158019065, "num_tokens": 209067.0, "step": 320 }, { "entropy": 1.5832848131656647, "epoch": 3.125301204819277, "grad_norm": 1.7512741088867188, "learning_rate": 7.686274509803923e-05, "loss": 1.5101547241210938, "mean_token_accuracy": 0.6740351840853691, "num_tokens": 212352.0, "step": 325 }, { "entropy": 1.5094462752342224, "epoch": 3.1734939759036145, "grad_norm": 1.860220193862915, "learning_rate": 7.490196078431373e-05, "loss": 1.4551105499267578, "mean_token_accuracy": 0.6776747345924378, "num_tokens": 215682.0, "step": 330 }, { "entropy": 1.522706066071987, "epoch": 3.221686746987952, "grad_norm": 1.954549789428711, "learning_rate": 7.294117647058823e-05, "loss": 1.4975555419921875, "mean_token_accuracy": 0.6802921906113625, "num_tokens": 219099.0, "step": 335 }, { "entropy": 1.409603290259838, "epoch": 3.269879518072289, "grad_norm": 1.8153287172317505, "learning_rate": 7.098039215686276e-05, "loss": 1.4376014709472655, "mean_token_accuracy": 0.7023592889308929, "num_tokens": 222041.0, "step": 340 }, { "entropy": 1.5369486555457115, "epoch": 3.3180722891566266, "grad_norm": 2.893878698348999, "learning_rate": 6.901960784313726e-05, "loss": 1.521450901031494, "mean_token_accuracy": 0.6780011773109436, "num_tokens": 225295.0, "step": 345 }, { "entropy": 1.464533470571041, "epoch": 3.3662650602409636, "grad_norm": 2.23521089553833, "learning_rate": 6.705882352941176e-05, "loss": 1.4850872993469237, "mean_token_accuracy": 0.6781729541718959, "num_tokens": 228520.0, "step": 350 }, { "entropy": 1.5792654797434806, "epoch": 3.414457831325301, "grad_norm": 2.3811116218566895, "learning_rate": 6.509803921568627e-05, "loss": 1.5071654319763184, "mean_token_accuracy": 0.6727619431912899, "num_tokens": 231944.0, "step": 355 }, { "entropy": 1.5043073087930678, "epoch": 3.4626506024096386, "grad_norm": 2.0156142711639404, "learning_rate": 6.313725490196079e-05, "loss": 1.457301425933838, "mean_token_accuracy": 0.6823700666427612, "num_tokens": 235338.0, "step": 360 }, { "entropy": 1.515394613146782, "epoch": 3.5108433734939757, "grad_norm": 2.451681613922119, "learning_rate": 6.11764705882353e-05, "loss": 1.5563648223876954, "mean_token_accuracy": 0.6691546641290188, "num_tokens": 238515.0, "step": 365 }, { "entropy": 1.3954612508416175, "epoch": 3.559036144578313, "grad_norm": 2.3322858810424805, "learning_rate": 5.921568627450981e-05, "loss": 1.3666942596435547, "mean_token_accuracy": 0.7175338268280029, "num_tokens": 241407.0, "step": 370 }, { "entropy": 1.55018198043108, "epoch": 3.6072289156626507, "grad_norm": 2.3056695461273193, "learning_rate": 5.725490196078431e-05, "loss": 1.5389293670654296, "mean_token_accuracy": 0.6681547790765763, "num_tokens": 244810.0, "step": 375 }, { "entropy": 1.5046127676963805, "epoch": 3.6554216867469878, "grad_norm": 3.010859966278076, "learning_rate": 5.529411764705883e-05, "loss": 1.4678150177001954, "mean_token_accuracy": 0.6847188517451286, "num_tokens": 247917.0, "step": 380 }, { "entropy": 1.4361775398254395, "epoch": 3.7036144578313253, "grad_norm": 2.5851047039031982, "learning_rate": 5.333333333333333e-05, "loss": 1.3650499343872071, "mean_token_accuracy": 0.6972122386097908, "num_tokens": 251035.0, "step": 385 }, { "entropy": 1.3817903518676757, "epoch": 3.7518072289156628, "grad_norm": 2.435213565826416, "learning_rate": 5.137254901960784e-05, "loss": 1.4766757011413574, "mean_token_accuracy": 0.6866693139076233, "num_tokens": 254564.0, "step": 390 }, { "entropy": 1.4502640128135682, "epoch": 3.8, "grad_norm": 2.1120645999908447, "learning_rate": 4.9411764705882355e-05, "loss": 1.433640480041504, "mean_token_accuracy": 0.6859976917505264, "num_tokens": 258001.0, "step": 395 }, { "entropy": 1.539687316119671, "epoch": 3.8481927710843373, "grad_norm": 2.2516636848449707, "learning_rate": 4.745098039215686e-05, "loss": 1.4595802307128907, "mean_token_accuracy": 0.682227948307991, "num_tokens": 260974.0, "step": 400 }, { "entropy": 1.4997100606560707, "epoch": 3.896385542168675, "grad_norm": 2.310636281967163, "learning_rate": 4.549019607843137e-05, "loss": 1.5333876609802246, "mean_token_accuracy": 0.6781212002038955, "num_tokens": 264415.0, "step": 405 }, { "entropy": 1.5281791225075723, "epoch": 3.944578313253012, "grad_norm": 2.4731054306030273, "learning_rate": 4.3529411764705885e-05, "loss": 1.5099031448364257, "mean_token_accuracy": 0.6849689528346061, "num_tokens": 267945.0, "step": 410 }, { "entropy": 1.5134592086076737, "epoch": 3.9927710843373494, "grad_norm": 2.097576379776001, "learning_rate": 4.156862745098039e-05, "loss": 1.5098279953002929, "mean_token_accuracy": 0.6759081065654755, "num_tokens": 271493.0, "step": 415 }, { "epoch": 4.0, "eval_entropy": 1.650996024792011, "eval_loss": 1.719327688217163, "eval_mean_token_accuracy": 0.6236885969455426, "eval_num_tokens": 272004.0, "eval_runtime": 14.8466, "eval_samples_per_second": 14.01, "eval_steps_per_second": 1.751, "step": 416 }, { "entropy": 1.461619540264732, "epoch": 4.03855421686747, "grad_norm": 2.1332545280456543, "learning_rate": 3.96078431372549e-05, "loss": 1.4738554954528809, "mean_token_accuracy": 0.6778466685822135, "num_tokens": 274843.0, "step": 420 }, { "entropy": 1.4357808396220206, "epoch": 4.086746987951807, "grad_norm": 2.94267201423645, "learning_rate": 3.7647058823529415e-05, "loss": 1.2882400512695313, "mean_token_accuracy": 0.7100980252027511, "num_tokens": 277622.0, "step": 425 }, { "entropy": 1.5216135740280152, "epoch": 4.134939759036144, "grad_norm": 2.0942740440368652, "learning_rate": 3.568627450980392e-05, "loss": 1.4425686836242675, "mean_token_accuracy": 0.6826648101210594, "num_tokens": 281115.0, "step": 430 }, { "entropy": 1.4814609438180923, "epoch": 4.183132530120482, "grad_norm": 1.7694135904312134, "learning_rate": 3.372549019607844e-05, "loss": 1.4820951461791991, "mean_token_accuracy": 0.6858769103884697, "num_tokens": 284784.0, "step": 435 }, { "entropy": 1.4060292541980743, "epoch": 4.231325301204819, "grad_norm": 1.7684255838394165, "learning_rate": 3.176470588235294e-05, "loss": 1.464186668395996, "mean_token_accuracy": 0.6873476430773735, "num_tokens": 288256.0, "step": 440 }, { "entropy": 1.4001563966274262, "epoch": 4.279518072289156, "grad_norm": 2.206958770751953, "learning_rate": 2.9803921568627453e-05, "loss": 1.4205841064453124, "mean_token_accuracy": 0.6965109631419182, "num_tokens": 291712.0, "step": 445 }, { "entropy": 1.4542587012052537, "epoch": 4.327710843373494, "grad_norm": 2.2863240242004395, "learning_rate": 2.7843137254901964e-05, "loss": 1.3530636787414552, "mean_token_accuracy": 0.6990203335881233, "num_tokens": 294817.0, "step": 450 }, { "entropy": 1.4617966890335083, "epoch": 4.375903614457831, "grad_norm": 2.059224843978882, "learning_rate": 2.5882352941176475e-05, "loss": 1.4458779335021972, "mean_token_accuracy": 0.6859977036714554, "num_tokens": 298135.0, "step": 455 }, { "entropy": 1.4295916080474853, "epoch": 4.424096385542168, "grad_norm": 2.397486686706543, "learning_rate": 2.3921568627450983e-05, "loss": 1.3852792739868165, "mean_token_accuracy": 0.6985011547803879, "num_tokens": 301380.0, "step": 460 }, { "entropy": 1.4523922324180603, "epoch": 4.472289156626506, "grad_norm": 2.7501327991485596, "learning_rate": 2.196078431372549e-05, "loss": 1.3924354553222655, "mean_token_accuracy": 0.682592722773552, "num_tokens": 304449.0, "step": 465 }, { "entropy": 1.4958537325263024, "epoch": 4.5204819277108435, "grad_norm": 2.457711935043335, "learning_rate": 2e-05, "loss": 1.4587836265563965, "mean_token_accuracy": 0.6754888102412224, "num_tokens": 307631.0, "step": 470 }, { "entropy": 1.4366480574011802, "epoch": 4.5686746987951805, "grad_norm": 2.3415169715881348, "learning_rate": 1.803921568627451e-05, "loss": 1.3680506706237794, "mean_token_accuracy": 0.7045732125639915, "num_tokens": 310718.0, "step": 475 }, { "entropy": 1.4801016479730607, "epoch": 4.6168674698795185, "grad_norm": 2.1724977493286133, "learning_rate": 1.607843137254902e-05, "loss": 1.4241137504577637, "mean_token_accuracy": 0.6980501919984817, "num_tokens": 313936.0, "step": 480 }, { "entropy": 1.5258657872676848, "epoch": 4.6650602409638555, "grad_norm": 2.35538387298584, "learning_rate": 1.411764705882353e-05, "loss": 1.3901150703430176, "mean_token_accuracy": 0.6908862113952636, "num_tokens": 317225.0, "step": 485 }, { "entropy": 1.5328210130333901, "epoch": 4.713253012048193, "grad_norm": 2.4136812686920166, "learning_rate": 1.215686274509804e-05, "loss": 1.5781697273254394, "mean_token_accuracy": 0.667643653601408, "num_tokens": 320998.0, "step": 490 }, { "entropy": 1.41236270070076, "epoch": 4.76144578313253, "grad_norm": 2.197669744491577, "learning_rate": 1.0196078431372549e-05, "loss": 1.412532138824463, "mean_token_accuracy": 0.7016989126801491, "num_tokens": 324049.0, "step": 495 }, { "entropy": 1.4892181918025016, "epoch": 4.809638554216868, "grad_norm": 2.3088886737823486, "learning_rate": 8.23529411764706e-06, "loss": 1.516150665283203, "mean_token_accuracy": 0.681061764806509, "num_tokens": 327578.0, "step": 500 }, { "entropy": 1.413595749437809, "epoch": 4.857831325301205, "grad_norm": 2.792482852935791, "learning_rate": 6.274509803921569e-06, "loss": 1.3113953590393066, "mean_token_accuracy": 0.7035295680165291, "num_tokens": 330740.0, "step": 505 }, { "entropy": 1.3732035428285598, "epoch": 4.906024096385542, "grad_norm": 2.567453145980835, "learning_rate": 4.313725490196079e-06, "loss": 1.3159814834594727, "mean_token_accuracy": 0.7268049910664558, "num_tokens": 334020.0, "step": 510 }, { "entropy": 1.4876835718750954, "epoch": 4.95421686746988, "grad_norm": 2.4423370361328125, "learning_rate": 2.3529411764705885e-06, "loss": 1.4042280197143555, "mean_token_accuracy": 0.7043518707156181, "num_tokens": 336979.0, "step": 515 }, { "entropy": 1.4772268110199978, "epoch": 5.0, "grad_norm": 2.651355028152466, "learning_rate": 3.921568627450981e-07, "loss": 1.4333177566528321, "mean_token_accuracy": 0.6867847709279311, "num_tokens": 340005.0, "step": 520 }, { "epoch": 5.0, "eval_entropy": 1.6117543578147888, "eval_loss": 1.7184369564056396, "eval_mean_token_accuracy": 0.6235387462836045, "eval_num_tokens": 340005.0, "eval_runtime": 14.8702, "eval_samples_per_second": 13.988, "eval_steps_per_second": 1.748, "step": 520 } ], "logging_steps": 5, "max_steps": 520, "num_input_tokens_seen": 0, "num_train_epochs": 5, "save_steps": 500, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 2115032078315520.0, "train_batch_size": 1, "trial_name": null, "trial_params": null }