shake-spear-neftune / trainer_state.json
arshjaved's picture
Experiment A: baseline + NEFTune (neftune_noise_alpha=5), seed=42
4f5f2de verified
Raw
History Blame Contribute Delete
33.5 kB
{
"best_global_step": 520,
"best_metric": 1.7184369564056396,
"best_model_checkpoint": "/kaggle/working/exp_a/checkpoint-520",
"epoch": 5.0,
"eval_steps": 500,
"global_step": 520,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"entropy": 2.5125404238700866,
"epoch": 0.04819277108433735,
"grad_norm": 3.107343912124634,
"learning_rate": 8e-05,
"loss": 3.331409454345703,
"mean_token_accuracy": 0.4246453382074833,
"num_tokens": 3544.0,
"step": 5
},
{
"entropy": 2.473379173874855,
"epoch": 0.0963855421686747,
"grad_norm": 4.13798189163208,
"learning_rate": 0.00018,
"loss": 3.170204734802246,
"mean_token_accuracy": 0.44643297120928765,
"num_tokens": 6921.0,
"step": 10
},
{
"entropy": 2.7136070847511293,
"epoch": 0.14457831325301204,
"grad_norm": 1.889716625213623,
"learning_rate": 0.00019843137254901963,
"loss": 2.8694551467895506,
"mean_token_accuracy": 0.4593485899269581,
"num_tokens": 9897.0,
"step": 15
},
{
"entropy": 2.638975989818573,
"epoch": 0.1927710843373494,
"grad_norm": 1.5089645385742188,
"learning_rate": 0.00019647058823529413,
"loss": 2.4013465881347655,
"mean_token_accuracy": 0.5249107554554939,
"num_tokens": 13386.0,
"step": 20
},
{
"entropy": 2.554114228487015,
"epoch": 0.24096385542168675,
"grad_norm": 1.3503361940383911,
"learning_rate": 0.00019450980392156863,
"loss": 2.3163000106811524,
"mean_token_accuracy": 0.56058479398489,
"num_tokens": 16770.0,
"step": 25
},
{
"entropy": 2.2394246786832808,
"epoch": 0.2891566265060241,
"grad_norm": 1.2784709930419922,
"learning_rate": 0.00019254901960784316,
"loss": 2.078316879272461,
"mean_token_accuracy": 0.5896236382424831,
"num_tokens": 19815.0,
"step": 30
},
{
"entropy": 2.1424703538417815,
"epoch": 0.3373493975903614,
"grad_norm": 2.2359020709991455,
"learning_rate": 0.00019058823529411766,
"loss": 2.087246894836426,
"mean_token_accuracy": 0.5787902362644672,
"num_tokens": 22956.0,
"step": 35
},
{
"entropy": 2.093654748797417,
"epoch": 0.3855421686746988,
"grad_norm": 2.349356174468994,
"learning_rate": 0.00018862745098039216,
"loss": 2.0384281158447264,
"mean_token_accuracy": 0.5887037836015224,
"num_tokens": 26147.0,
"step": 40
},
{
"entropy": 2.0577339619398116,
"epoch": 0.43373493975903615,
"grad_norm": 1.649864912033081,
"learning_rate": 0.0001866666666666667,
"loss": 2.0328414916992186,
"mean_token_accuracy": 0.602185083180666,
"num_tokens": 29290.0,
"step": 45
},
{
"entropy": 2.033597409725189,
"epoch": 0.4819277108433735,
"grad_norm": 1.2588778734207153,
"learning_rate": 0.0001847058823529412,
"loss": 2.0368608474731444,
"mean_token_accuracy": 0.5883708715438842,
"num_tokens": 32774.0,
"step": 50
},
{
"entropy": 1.9881025731563569,
"epoch": 0.5301204819277109,
"grad_norm": 1.3411701917648315,
"learning_rate": 0.0001827450980392157,
"loss": 1.946812629699707,
"mean_token_accuracy": 0.5845362402498722,
"num_tokens": 36361.0,
"step": 55
},
{
"entropy": 1.974584263563156,
"epoch": 0.5783132530120482,
"grad_norm": 2.2939326763153076,
"learning_rate": 0.00018078431372549022,
"loss": 2.0149436950683595,
"mean_token_accuracy": 0.5910582594573498,
"num_tokens": 39883.0,
"step": 60
},
{
"entropy": 1.892711740732193,
"epoch": 0.6265060240963856,
"grad_norm": 2.040877342224121,
"learning_rate": 0.00017882352941176472,
"loss": 1.8759027481079102,
"mean_token_accuracy": 0.617172273248434,
"num_tokens": 43257.0,
"step": 65
},
{
"entropy": 1.921028771996498,
"epoch": 0.6746987951807228,
"grad_norm": 1.2713969945907593,
"learning_rate": 0.00017686274509803922,
"loss": 1.8866106033325196,
"mean_token_accuracy": 0.6131292454898357,
"num_tokens": 46204.0,
"step": 70
},
{
"entropy": 1.8816440194845199,
"epoch": 0.7228915662650602,
"grad_norm": 1.4800573587417603,
"learning_rate": 0.00017490196078431375,
"loss": 1.9057266235351562,
"mean_token_accuracy": 0.5993098318576813,
"num_tokens": 49793.0,
"step": 75
},
{
"entropy": 1.8062270611524582,
"epoch": 0.7710843373493976,
"grad_norm": 2.195326566696167,
"learning_rate": 0.00017294117647058825,
"loss": 1.8263084411621093,
"mean_token_accuracy": 0.6268978863954544,
"num_tokens": 53104.0,
"step": 80
},
{
"entropy": 1.7734803646802901,
"epoch": 0.8192771084337349,
"grad_norm": 1.90998375415802,
"learning_rate": 0.00017098039215686275,
"loss": 1.7766584396362304,
"mean_token_accuracy": 0.6333199128508568,
"num_tokens": 56062.0,
"step": 85
},
{
"entropy": 1.8309715777635573,
"epoch": 0.8674698795180723,
"grad_norm": 1.3006683588027954,
"learning_rate": 0.00016901960784313725,
"loss": 1.857182502746582,
"mean_token_accuracy": 0.6287190951406956,
"num_tokens": 59161.0,
"step": 90
},
{
"entropy": 1.8734614104032516,
"epoch": 0.9156626506024096,
"grad_norm": 1.5136709213256836,
"learning_rate": 0.00016705882352941178,
"loss": 1.8590967178344726,
"mean_token_accuracy": 0.6196285620331764,
"num_tokens": 62426.0,
"step": 95
},
{
"entropy": 1.7397653341293335,
"epoch": 0.963855421686747,
"grad_norm": 1.647998571395874,
"learning_rate": 0.00016509803921568628,
"loss": 1.7337995529174806,
"mean_token_accuracy": 0.6293763548135758,
"num_tokens": 65573.0,
"step": 100
},
{
"epoch": 1.0,
"eval_entropy": 1.8366776154591486,
"eval_loss": 1.8674575090408325,
"eval_mean_token_accuracy": 0.5964838358072134,
"eval_num_tokens": 68001.0,
"eval_runtime": 14.8665,
"eval_samples_per_second": 13.991,
"eval_steps_per_second": 1.749,
"step": 104
},
{
"entropy": 1.7183971075635207,
"epoch": 1.0096385542168675,
"grad_norm": 2.0711727142333984,
"learning_rate": 0.00016313725490196078,
"loss": 1.7683034896850587,
"mean_token_accuracy": 0.6259415377127496,
"num_tokens": 68613.0,
"step": 105
},
{
"entropy": 1.8635606437921524,
"epoch": 1.0578313253012048,
"grad_norm": 1.2785375118255615,
"learning_rate": 0.0001611764705882353,
"loss": 1.8564044952392578,
"mean_token_accuracy": 0.6166318386793137,
"num_tokens": 72379.0,
"step": 110
},
{
"entropy": 1.8101747632026672,
"epoch": 1.106024096385542,
"grad_norm": 1.634289264678955,
"learning_rate": 0.0001592156862745098,
"loss": 1.8175914764404297,
"mean_token_accuracy": 0.6229961954057217,
"num_tokens": 75330.0,
"step": 115
},
{
"entropy": 1.7687339812517167,
"epoch": 1.1542168674698796,
"grad_norm": 1.4806301593780518,
"learning_rate": 0.0001572549019607843,
"loss": 1.7809358596801759,
"mean_token_accuracy": 0.6301124401390552,
"num_tokens": 78552.0,
"step": 120
},
{
"entropy": 1.7583049044013024,
"epoch": 1.202409638554217,
"grad_norm": 1.6424956321716309,
"learning_rate": 0.00015529411764705884,
"loss": 1.744133186340332,
"mean_token_accuracy": 0.6302636325359344,
"num_tokens": 81798.0,
"step": 125
},
{
"entropy": 1.6877357229590415,
"epoch": 1.2506024096385542,
"grad_norm": 1.5315968990325928,
"learning_rate": 0.00015333333333333334,
"loss": 1.637476348876953,
"mean_token_accuracy": 0.650700282305479,
"num_tokens": 85117.0,
"step": 130
},
{
"entropy": 1.7318841934204101,
"epoch": 1.2987951807228915,
"grad_norm": 1.4535908699035645,
"learning_rate": 0.00015137254901960784,
"loss": 1.7752351760864258,
"mean_token_accuracy": 0.6226705864071846,
"num_tokens": 88742.0,
"step": 135
},
{
"entropy": 1.7382851645350457,
"epoch": 1.346987951807229,
"grad_norm": 1.5624728202819824,
"learning_rate": 0.00014941176470588237,
"loss": 1.7821353912353515,
"mean_token_accuracy": 0.6388084962964058,
"num_tokens": 92210.0,
"step": 140
},
{
"entropy": 1.657819251716137,
"epoch": 1.3951807228915662,
"grad_norm": 1.827693223953247,
"learning_rate": 0.00014745098039215687,
"loss": 1.620370864868164,
"mean_token_accuracy": 0.6545050926506519,
"num_tokens": 95303.0,
"step": 145
},
{
"entropy": 1.6616802349686624,
"epoch": 1.4433734939759035,
"grad_norm": 1.8607943058013916,
"learning_rate": 0.00014549019607843137,
"loss": 1.5599291801452637,
"mean_token_accuracy": 0.6593139126896859,
"num_tokens": 98384.0,
"step": 150
},
{
"entropy": 1.5860232621431352,
"epoch": 1.491566265060241,
"grad_norm": 1.9932466745376587,
"learning_rate": 0.0001435294117647059,
"loss": 1.6419692993164063,
"mean_token_accuracy": 0.6570444725453853,
"num_tokens": 101490.0,
"step": 155
},
{
"entropy": 1.551141259074211,
"epoch": 1.5397590361445783,
"grad_norm": 2.086176872253418,
"learning_rate": 0.0001415686274509804,
"loss": 1.5585495948791503,
"mean_token_accuracy": 0.6683049827814103,
"num_tokens": 104191.0,
"step": 160
},
{
"entropy": 1.6165375381708145,
"epoch": 1.5879518072289156,
"grad_norm": 1.7320177555084229,
"learning_rate": 0.0001396078431372549,
"loss": 1.6773378372192382,
"mean_token_accuracy": 0.6502716824412346,
"num_tokens": 107261.0,
"step": 165
},
{
"entropy": 1.704845277965069,
"epoch": 1.636144578313253,
"grad_norm": 1.967751383781433,
"learning_rate": 0.00013764705882352943,
"loss": 1.7607194900512695,
"mean_token_accuracy": 0.6385575778782367,
"num_tokens": 110608.0,
"step": 170
},
{
"entropy": 1.6652135044336318,
"epoch": 1.6843373493975904,
"grad_norm": 1.616722822189331,
"learning_rate": 0.00013568627450980393,
"loss": 1.6635320663452149,
"mean_token_accuracy": 0.6614525228738785,
"num_tokens": 113881.0,
"step": 175
},
{
"entropy": 1.6908259093761444,
"epoch": 1.7325301204819277,
"grad_norm": 1.711729645729065,
"learning_rate": 0.00013372549019607843,
"loss": 1.6920236587524413,
"mean_token_accuracy": 0.6418330393731594,
"num_tokens": 117044.0,
"step": 180
},
{
"entropy": 1.7484796479344369,
"epoch": 1.7807228915662652,
"grad_norm": 1.5955023765563965,
"learning_rate": 0.00013176470588235296,
"loss": 1.717266845703125,
"mean_token_accuracy": 0.6351907752454281,
"num_tokens": 120606.0,
"step": 185
},
{
"entropy": 1.6216741874814034,
"epoch": 1.8289156626506025,
"grad_norm": 1.622183084487915,
"learning_rate": 0.00012980392156862746,
"loss": 1.674321174621582,
"mean_token_accuracy": 0.6502599447965622,
"num_tokens": 123899.0,
"step": 190
},
{
"entropy": 1.6669133231043816,
"epoch": 1.8771084337349397,
"grad_norm": 1.867492914199829,
"learning_rate": 0.00012784313725490196,
"loss": 1.7255191802978516,
"mean_token_accuracy": 0.6400439321994782,
"num_tokens": 127473.0,
"step": 195
},
{
"entropy": 1.675342607498169,
"epoch": 1.9253012048192772,
"grad_norm": 1.855635166168213,
"learning_rate": 0.0001258823529411765,
"loss": 1.7129255294799806,
"mean_token_accuracy": 0.62674540579319,
"num_tokens": 130771.0,
"step": 200
},
{
"entropy": 1.6791207402944566,
"epoch": 1.9734939759036143,
"grad_norm": 1.7303972244262695,
"learning_rate": 0.000123921568627451,
"loss": 1.7065092086791993,
"mean_token_accuracy": 0.6443807639181613,
"num_tokens": 134125.0,
"step": 205
},
{
"epoch": 2.0,
"eval_entropy": 1.8138972566677973,
"eval_loss": 1.7650498151779175,
"eval_mean_token_accuracy": 0.6141013021652515,
"eval_num_tokens": 136002.0,
"eval_runtime": 14.8533,
"eval_samples_per_second": 14.004,
"eval_steps_per_second": 1.75,
"step": 208
},
{
"entropy": 1.6970797196814889,
"epoch": 2.019277108433735,
"grad_norm": 1.7416448593139648,
"learning_rate": 0.0001219607843137255,
"loss": 1.692988395690918,
"mean_token_accuracy": 0.6389423718577937,
"num_tokens": 137377.0,
"step": 210
},
{
"entropy": 1.7040952891111374,
"epoch": 2.067469879518072,
"grad_norm": 1.8894716501235962,
"learning_rate": 0.00012,
"loss": 1.6213483810424805,
"mean_token_accuracy": 0.6468638084828854,
"num_tokens": 141109.0,
"step": 215
},
{
"entropy": 1.5890287652611732,
"epoch": 2.1156626506024097,
"grad_norm": 2.304762601852417,
"learning_rate": 0.00011803921568627452,
"loss": 1.5466879844665526,
"mean_token_accuracy": 0.6704243734478951,
"num_tokens": 144100.0,
"step": 220
},
{
"entropy": 1.6182831943035125,
"epoch": 2.163855421686747,
"grad_norm": 1.9651720523834229,
"learning_rate": 0.00011607843137254903,
"loss": 1.6720081329345704,
"mean_token_accuracy": 0.65214222073555,
"num_tokens": 147584.0,
"step": 225
},
{
"entropy": 1.5671581000089645,
"epoch": 2.212048192771084,
"grad_norm": 1.9738132953643799,
"learning_rate": 0.00011411764705882353,
"loss": 1.647587203979492,
"mean_token_accuracy": 0.6729991242289544,
"num_tokens": 150511.0,
"step": 230
},
{
"entropy": 1.6577306151390077,
"epoch": 2.2602409638554217,
"grad_norm": 1.8251382112503052,
"learning_rate": 0.00011215686274509805,
"loss": 1.5790367126464844,
"mean_token_accuracy": 0.6663866609334945,
"num_tokens": 154053.0,
"step": 235
},
{
"entropy": 1.5505558550357819,
"epoch": 2.3084337349397592,
"grad_norm": 2.1022140979766846,
"learning_rate": 0.00011019607843137256,
"loss": 1.588535976409912,
"mean_token_accuracy": 0.6634533762931824,
"num_tokens": 157138.0,
"step": 240
},
{
"entropy": 1.5530098304152489,
"epoch": 2.3566265060240963,
"grad_norm": 2.045732259750366,
"learning_rate": 0.00010823529411764706,
"loss": 1.5270882606506349,
"mean_token_accuracy": 0.6741401948034763,
"num_tokens": 160436.0,
"step": 245
},
{
"entropy": 1.596367821097374,
"epoch": 2.404819277108434,
"grad_norm": 1.6421279907226562,
"learning_rate": 0.00010627450980392158,
"loss": 1.56561279296875,
"mean_token_accuracy": 0.6635179311037064,
"num_tokens": 163761.0,
"step": 250
},
{
"entropy": 1.6159405663609505,
"epoch": 2.453012048192771,
"grad_norm": 1.8586058616638184,
"learning_rate": 0.00010431372549019609,
"loss": 1.5304578781127929,
"mean_token_accuracy": 0.6609816014766693,
"num_tokens": 166898.0,
"step": 255
},
{
"entropy": 1.5298877507448196,
"epoch": 2.5012048192771084,
"grad_norm": 2.2185778617858887,
"learning_rate": 0.00010235294117647058,
"loss": 1.552015781402588,
"mean_token_accuracy": 0.6700602419674396,
"num_tokens": 169909.0,
"step": 260
},
{
"entropy": 1.6168403923511505,
"epoch": 2.549397590361446,
"grad_norm": 1.8064223527908325,
"learning_rate": 0.00010039215686274511,
"loss": 1.5809405326843262,
"mean_token_accuracy": 0.6531007468700409,
"num_tokens": 173365.0,
"step": 265
},
{
"entropy": 1.6430342257022859,
"epoch": 2.597590361445783,
"grad_norm": 2.219008684158325,
"learning_rate": 9.843137254901961e-05,
"loss": 1.661992073059082,
"mean_token_accuracy": 0.6535247735679149,
"num_tokens": 176834.0,
"step": 270
},
{
"entropy": 1.5823266848921775,
"epoch": 2.6457831325301204,
"grad_norm": 1.9590431451797485,
"learning_rate": 9.647058823529412e-05,
"loss": 1.515106773376465,
"mean_token_accuracy": 0.6696497216820717,
"num_tokens": 180153.0,
"step": 275
},
{
"entropy": 1.6698341622948647,
"epoch": 2.693975903614458,
"grad_norm": 1.6002068519592285,
"learning_rate": 9.450980392156862e-05,
"loss": 1.6272111892700196,
"mean_token_accuracy": 0.6547548659145832,
"num_tokens": 183512.0,
"step": 280
},
{
"entropy": 1.5231620341539382,
"epoch": 2.742168674698795,
"grad_norm": 1.950395941734314,
"learning_rate": 9.254901960784315e-05,
"loss": 1.5006098747253418,
"mean_token_accuracy": 0.679551114141941,
"num_tokens": 186472.0,
"step": 285
},
{
"entropy": 1.4535922273993491,
"epoch": 2.7903614457831325,
"grad_norm": 2.09175705909729,
"learning_rate": 9.058823529411765e-05,
"loss": 1.467922306060791,
"mean_token_accuracy": 0.695755822956562,
"num_tokens": 189517.0,
"step": 290
},
{
"entropy": 1.5150477439165115,
"epoch": 2.83855421686747,
"grad_norm": 2.532780170440674,
"learning_rate": 8.862745098039215e-05,
"loss": 1.5379227638244628,
"mean_token_accuracy": 0.6792982123792172,
"num_tokens": 192652.0,
"step": 295
},
{
"entropy": 1.5019459277391434,
"epoch": 2.886746987951807,
"grad_norm": 2.0246798992156982,
"learning_rate": 8.666666666666667e-05,
"loss": 1.5374203681945802,
"mean_token_accuracy": 0.6916215568780899,
"num_tokens": 195757.0,
"step": 300
},
{
"entropy": 1.480114082992077,
"epoch": 2.9349397590361446,
"grad_norm": 1.8221111297607422,
"learning_rate": 8.470588235294118e-05,
"loss": 1.4599919319152832,
"mean_token_accuracy": 0.6793610081076622,
"num_tokens": 198807.0,
"step": 305
},
{
"entropy": 1.5545434340834619,
"epoch": 2.983132530120482,
"grad_norm": 1.9728882312774658,
"learning_rate": 8.274509803921568e-05,
"loss": 1.5928434371948241,
"mean_token_accuracy": 0.6610011547803879,
"num_tokens": 202500.0,
"step": 310
},
{
"epoch": 3.0,
"eval_entropy": 1.6712642128650959,
"eval_loss": 1.735916256904602,
"eval_mean_token_accuracy": 0.6211101160599635,
"eval_num_tokens": 204003.0,
"eval_runtime": 14.8568,
"eval_samples_per_second": 14.0,
"eval_steps_per_second": 1.75,
"step": 312
},
{
"entropy": 1.5852490004740263,
"epoch": 3.0289156626506024,
"grad_norm": 2.1537606716156006,
"learning_rate": 8.07843137254902e-05,
"loss": 1.5842859268188476,
"mean_token_accuracy": 0.6565342867060712,
"num_tokens": 205682.0,
"step": 315
},
{
"entropy": 1.5908529162406921,
"epoch": 3.07710843373494,
"grad_norm": 2.137528657913208,
"learning_rate": 7.882352941176471e-05,
"loss": 1.5232861518859864,
"mean_token_accuracy": 0.6684555158019065,
"num_tokens": 209067.0,
"step": 320
},
{
"entropy": 1.5832848131656647,
"epoch": 3.125301204819277,
"grad_norm": 1.7512741088867188,
"learning_rate": 7.686274509803923e-05,
"loss": 1.5101547241210938,
"mean_token_accuracy": 0.6740351840853691,
"num_tokens": 212352.0,
"step": 325
},
{
"entropy": 1.5094462752342224,
"epoch": 3.1734939759036145,
"grad_norm": 1.860220193862915,
"learning_rate": 7.490196078431373e-05,
"loss": 1.4551105499267578,
"mean_token_accuracy": 0.6776747345924378,
"num_tokens": 215682.0,
"step": 330
},
{
"entropy": 1.522706066071987,
"epoch": 3.221686746987952,
"grad_norm": 1.954549789428711,
"learning_rate": 7.294117647058823e-05,
"loss": 1.4975555419921875,
"mean_token_accuracy": 0.6802921906113625,
"num_tokens": 219099.0,
"step": 335
},
{
"entropy": 1.409603290259838,
"epoch": 3.269879518072289,
"grad_norm": 1.8153287172317505,
"learning_rate": 7.098039215686276e-05,
"loss": 1.4376014709472655,
"mean_token_accuracy": 0.7023592889308929,
"num_tokens": 222041.0,
"step": 340
},
{
"entropy": 1.5369486555457115,
"epoch": 3.3180722891566266,
"grad_norm": 2.893878698348999,
"learning_rate": 6.901960784313726e-05,
"loss": 1.521450901031494,
"mean_token_accuracy": 0.6780011773109436,
"num_tokens": 225295.0,
"step": 345
},
{
"entropy": 1.464533470571041,
"epoch": 3.3662650602409636,
"grad_norm": 2.23521089553833,
"learning_rate": 6.705882352941176e-05,
"loss": 1.4850872993469237,
"mean_token_accuracy": 0.6781729541718959,
"num_tokens": 228520.0,
"step": 350
},
{
"entropy": 1.5792654797434806,
"epoch": 3.414457831325301,
"grad_norm": 2.3811116218566895,
"learning_rate": 6.509803921568627e-05,
"loss": 1.5071654319763184,
"mean_token_accuracy": 0.6727619431912899,
"num_tokens": 231944.0,
"step": 355
},
{
"entropy": 1.5043073087930678,
"epoch": 3.4626506024096386,
"grad_norm": 2.0156142711639404,
"learning_rate": 6.313725490196079e-05,
"loss": 1.457301425933838,
"mean_token_accuracy": 0.6823700666427612,
"num_tokens": 235338.0,
"step": 360
},
{
"entropy": 1.515394613146782,
"epoch": 3.5108433734939757,
"grad_norm": 2.451681613922119,
"learning_rate": 6.11764705882353e-05,
"loss": 1.5563648223876954,
"mean_token_accuracy": 0.6691546641290188,
"num_tokens": 238515.0,
"step": 365
},
{
"entropy": 1.3954612508416175,
"epoch": 3.559036144578313,
"grad_norm": 2.3322858810424805,
"learning_rate": 5.921568627450981e-05,
"loss": 1.3666942596435547,
"mean_token_accuracy": 0.7175338268280029,
"num_tokens": 241407.0,
"step": 370
},
{
"entropy": 1.55018198043108,
"epoch": 3.6072289156626507,
"grad_norm": 2.3056695461273193,
"learning_rate": 5.725490196078431e-05,
"loss": 1.5389293670654296,
"mean_token_accuracy": 0.6681547790765763,
"num_tokens": 244810.0,
"step": 375
},
{
"entropy": 1.5046127676963805,
"epoch": 3.6554216867469878,
"grad_norm": 3.010859966278076,
"learning_rate": 5.529411764705883e-05,
"loss": 1.4678150177001954,
"mean_token_accuracy": 0.6847188517451286,
"num_tokens": 247917.0,
"step": 380
},
{
"entropy": 1.4361775398254395,
"epoch": 3.7036144578313253,
"grad_norm": 2.5851047039031982,
"learning_rate": 5.333333333333333e-05,
"loss": 1.3650499343872071,
"mean_token_accuracy": 0.6972122386097908,
"num_tokens": 251035.0,
"step": 385
},
{
"entropy": 1.3817903518676757,
"epoch": 3.7518072289156628,
"grad_norm": 2.435213565826416,
"learning_rate": 5.137254901960784e-05,
"loss": 1.4766757011413574,
"mean_token_accuracy": 0.6866693139076233,
"num_tokens": 254564.0,
"step": 390
},
{
"entropy": 1.4502640128135682,
"epoch": 3.8,
"grad_norm": 2.1120645999908447,
"learning_rate": 4.9411764705882355e-05,
"loss": 1.433640480041504,
"mean_token_accuracy": 0.6859976917505264,
"num_tokens": 258001.0,
"step": 395
},
{
"entropy": 1.539687316119671,
"epoch": 3.8481927710843373,
"grad_norm": 2.2516636848449707,
"learning_rate": 4.745098039215686e-05,
"loss": 1.4595802307128907,
"mean_token_accuracy": 0.682227948307991,
"num_tokens": 260974.0,
"step": 400
},
{
"entropy": 1.4997100606560707,
"epoch": 3.896385542168675,
"grad_norm": 2.310636281967163,
"learning_rate": 4.549019607843137e-05,
"loss": 1.5333876609802246,
"mean_token_accuracy": 0.6781212002038955,
"num_tokens": 264415.0,
"step": 405
},
{
"entropy": 1.5281791225075723,
"epoch": 3.944578313253012,
"grad_norm": 2.4731054306030273,
"learning_rate": 4.3529411764705885e-05,
"loss": 1.5099031448364257,
"mean_token_accuracy": 0.6849689528346061,
"num_tokens": 267945.0,
"step": 410
},
{
"entropy": 1.5134592086076737,
"epoch": 3.9927710843373494,
"grad_norm": 2.097576379776001,
"learning_rate": 4.156862745098039e-05,
"loss": 1.5098279953002929,
"mean_token_accuracy": 0.6759081065654755,
"num_tokens": 271493.0,
"step": 415
},
{
"epoch": 4.0,
"eval_entropy": 1.650996024792011,
"eval_loss": 1.719327688217163,
"eval_mean_token_accuracy": 0.6236885969455426,
"eval_num_tokens": 272004.0,
"eval_runtime": 14.8466,
"eval_samples_per_second": 14.01,
"eval_steps_per_second": 1.751,
"step": 416
},
{
"entropy": 1.461619540264732,
"epoch": 4.03855421686747,
"grad_norm": 2.1332545280456543,
"learning_rate": 3.96078431372549e-05,
"loss": 1.4738554954528809,
"mean_token_accuracy": 0.6778466685822135,
"num_tokens": 274843.0,
"step": 420
},
{
"entropy": 1.4357808396220206,
"epoch": 4.086746987951807,
"grad_norm": 2.94267201423645,
"learning_rate": 3.7647058823529415e-05,
"loss": 1.2882400512695313,
"mean_token_accuracy": 0.7100980252027511,
"num_tokens": 277622.0,
"step": 425
},
{
"entropy": 1.5216135740280152,
"epoch": 4.134939759036144,
"grad_norm": 2.0942740440368652,
"learning_rate": 3.568627450980392e-05,
"loss": 1.4425686836242675,
"mean_token_accuracy": 0.6826648101210594,
"num_tokens": 281115.0,
"step": 430
},
{
"entropy": 1.4814609438180923,
"epoch": 4.183132530120482,
"grad_norm": 1.7694135904312134,
"learning_rate": 3.372549019607844e-05,
"loss": 1.4820951461791991,
"mean_token_accuracy": 0.6858769103884697,
"num_tokens": 284784.0,
"step": 435
},
{
"entropy": 1.4060292541980743,
"epoch": 4.231325301204819,
"grad_norm": 1.7684255838394165,
"learning_rate": 3.176470588235294e-05,
"loss": 1.464186668395996,
"mean_token_accuracy": 0.6873476430773735,
"num_tokens": 288256.0,
"step": 440
},
{
"entropy": 1.4001563966274262,
"epoch": 4.279518072289156,
"grad_norm": 2.206958770751953,
"learning_rate": 2.9803921568627453e-05,
"loss": 1.4205841064453124,
"mean_token_accuracy": 0.6965109631419182,
"num_tokens": 291712.0,
"step": 445
},
{
"entropy": 1.4542587012052537,
"epoch": 4.327710843373494,
"grad_norm": 2.2863240242004395,
"learning_rate": 2.7843137254901964e-05,
"loss": 1.3530636787414552,
"mean_token_accuracy": 0.6990203335881233,
"num_tokens": 294817.0,
"step": 450
},
{
"entropy": 1.4617966890335083,
"epoch": 4.375903614457831,
"grad_norm": 2.059224843978882,
"learning_rate": 2.5882352941176475e-05,
"loss": 1.4458779335021972,
"mean_token_accuracy": 0.6859977036714554,
"num_tokens": 298135.0,
"step": 455
},
{
"entropy": 1.4295916080474853,
"epoch": 4.424096385542168,
"grad_norm": 2.397486686706543,
"learning_rate": 2.3921568627450983e-05,
"loss": 1.3852792739868165,
"mean_token_accuracy": 0.6985011547803879,
"num_tokens": 301380.0,
"step": 460
},
{
"entropy": 1.4523922324180603,
"epoch": 4.472289156626506,
"grad_norm": 2.7501327991485596,
"learning_rate": 2.196078431372549e-05,
"loss": 1.3924354553222655,
"mean_token_accuracy": 0.682592722773552,
"num_tokens": 304449.0,
"step": 465
},
{
"entropy": 1.4958537325263024,
"epoch": 4.5204819277108435,
"grad_norm": 2.457711935043335,
"learning_rate": 2e-05,
"loss": 1.4587836265563965,
"mean_token_accuracy": 0.6754888102412224,
"num_tokens": 307631.0,
"step": 470
},
{
"entropy": 1.4366480574011802,
"epoch": 4.5686746987951805,
"grad_norm": 2.3415169715881348,
"learning_rate": 1.803921568627451e-05,
"loss": 1.3680506706237794,
"mean_token_accuracy": 0.7045732125639915,
"num_tokens": 310718.0,
"step": 475
},
{
"entropy": 1.4801016479730607,
"epoch": 4.6168674698795185,
"grad_norm": 2.1724977493286133,
"learning_rate": 1.607843137254902e-05,
"loss": 1.4241137504577637,
"mean_token_accuracy": 0.6980501919984817,
"num_tokens": 313936.0,
"step": 480
},
{
"entropy": 1.5258657872676848,
"epoch": 4.6650602409638555,
"grad_norm": 2.35538387298584,
"learning_rate": 1.411764705882353e-05,
"loss": 1.3901150703430176,
"mean_token_accuracy": 0.6908862113952636,
"num_tokens": 317225.0,
"step": 485
},
{
"entropy": 1.5328210130333901,
"epoch": 4.713253012048193,
"grad_norm": 2.4136812686920166,
"learning_rate": 1.215686274509804e-05,
"loss": 1.5781697273254394,
"mean_token_accuracy": 0.667643653601408,
"num_tokens": 320998.0,
"step": 490
},
{
"entropy": 1.41236270070076,
"epoch": 4.76144578313253,
"grad_norm": 2.197669744491577,
"learning_rate": 1.0196078431372549e-05,
"loss": 1.412532138824463,
"mean_token_accuracy": 0.7016989126801491,
"num_tokens": 324049.0,
"step": 495
},
{
"entropy": 1.4892181918025016,
"epoch": 4.809638554216868,
"grad_norm": 2.3088886737823486,
"learning_rate": 8.23529411764706e-06,
"loss": 1.516150665283203,
"mean_token_accuracy": 0.681061764806509,
"num_tokens": 327578.0,
"step": 500
},
{
"entropy": 1.413595749437809,
"epoch": 4.857831325301205,
"grad_norm": 2.792482852935791,
"learning_rate": 6.274509803921569e-06,
"loss": 1.3113953590393066,
"mean_token_accuracy": 0.7035295680165291,
"num_tokens": 330740.0,
"step": 505
},
{
"entropy": 1.3732035428285598,
"epoch": 4.906024096385542,
"grad_norm": 2.567453145980835,
"learning_rate": 4.313725490196079e-06,
"loss": 1.3159814834594727,
"mean_token_accuracy": 0.7268049910664558,
"num_tokens": 334020.0,
"step": 510
},
{
"entropy": 1.4876835718750954,
"epoch": 4.95421686746988,
"grad_norm": 2.4423370361328125,
"learning_rate": 2.3529411764705885e-06,
"loss": 1.4042280197143555,
"mean_token_accuracy": 0.7043518707156181,
"num_tokens": 336979.0,
"step": 515
},
{
"entropy": 1.4772268110199978,
"epoch": 5.0,
"grad_norm": 2.651355028152466,
"learning_rate": 3.921568627450981e-07,
"loss": 1.4333177566528321,
"mean_token_accuracy": 0.6867847709279311,
"num_tokens": 340005.0,
"step": 520
},
{
"epoch": 5.0,
"eval_entropy": 1.6117543578147888,
"eval_loss": 1.7184369564056396,
"eval_mean_token_accuracy": 0.6235387462836045,
"eval_num_tokens": 340005.0,
"eval_runtime": 14.8702,
"eval_samples_per_second": 13.988,
"eval_steps_per_second": 1.748,
"step": 520
}
],
"logging_steps": 5,
"max_steps": 520,
"num_input_tokens_seen": 0,
"num_train_epochs": 5,
"save_steps": 500,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": true
},
"attributes": {}
}
},
"total_flos": 2115032078315520.0,
"train_batch_size": 1,
"trial_name": null,
"trial_params": null
}