roun1-train3-final / trainer_state.json
master103525's picture
Upload folder using huggingface_hub
cbdba2f verified
Raw
History Blame Contribute Delete
34.4 kB
{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 0.5944244604316546,
"eval_steps": 500,
"global_step": 661,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.0044964028776978415,
"grad_norm": 34.8267936706543,
"learning_rate": 1.6634586466165415e-06,
"loss": 0.3603,
"mean_token_accuracy": 0.8805555582046509,
"num_tokens": 466767.0,
"step": 5
},
{
"epoch": 0.008992805755395683,
"grad_norm": 1.9446816444396973,
"learning_rate": 3.7427819548872183e-06,
"loss": 0.1555,
"mean_token_accuracy": 0.9567708373069763,
"num_tokens": 937804.0,
"step": 10
},
{
"epoch": 0.013489208633093525,
"grad_norm": 0.79410719871521,
"learning_rate": 5.822105263157896e-06,
"loss": 0.1184,
"mean_token_accuracy": 0.9576388835906983,
"num_tokens": 1408105.0,
"step": 15
},
{
"epoch": 0.017985611510791366,
"grad_norm": 0.5585373640060425,
"learning_rate": 7.901428571428572e-06,
"loss": 0.1104,
"mean_token_accuracy": 0.9598958492279053,
"num_tokens": 1875896.0,
"step": 20
},
{
"epoch": 0.022482014388489208,
"grad_norm": 0.6362137198448181,
"learning_rate": 9.98075187969925e-06,
"loss": 0.1046,
"mean_token_accuracy": 0.9623263955116272,
"num_tokens": 2342344.0,
"step": 25
},
{
"epoch": 0.02697841726618705,
"grad_norm": 0.817181408405304,
"learning_rate": 1.2060075187969928e-05,
"loss": 0.1047,
"mean_token_accuracy": 0.9623264074325562,
"num_tokens": 2810563.0,
"step": 30
},
{
"epoch": 0.03147482014388489,
"grad_norm": 0.7457462549209595,
"learning_rate": 1.4139398496240603e-05,
"loss": 0.1101,
"mean_token_accuracy": 0.9598958373069764,
"num_tokens": 3281330.0,
"step": 35
},
{
"epoch": 0.03597122302158273,
"grad_norm": 0.5849624872207642,
"learning_rate": 1.4555173218834344e-05,
"loss": 0.102,
"mean_token_accuracy": 0.9642361164093017,
"num_tokens": 3752355.0,
"step": 40
},
{
"epoch": 0.040467625899280574,
"grad_norm": 0.5536819100379944,
"learning_rate": 1.4554807846481353e-05,
"loss": 0.1003,
"mean_token_accuracy": 0.9621527791023254,
"num_tokens": 4218619.0,
"step": 45
},
{
"epoch": 0.044964028776978415,
"grad_norm": 0.5768638253211975,
"learning_rate": 1.4554161438444059e-05,
"loss": 0.1054,
"mean_token_accuracy": 0.9625000119209289,
"num_tokens": 4687504.0,
"step": 50
},
{
"epoch": 0.04946043165467626,
"grad_norm": 0.5772081017494202,
"learning_rate": 1.455323402800781e-05,
"loss": 0.0986,
"mean_token_accuracy": 0.9633680701255798,
"num_tokens": 5156586.0,
"step": 55
},
{
"epoch": 0.0539568345323741,
"grad_norm": 0.6602324843406677,
"learning_rate": 1.455202566292755e-05,
"loss": 0.1082,
"mean_token_accuracy": 0.9595486283302307,
"num_tokens": 5629757.0,
"step": 60
},
{
"epoch": 0.05845323741007194,
"grad_norm": 0.5798962116241455,
"learning_rate": 1.4550536405425362e-05,
"loss": 0.0927,
"mean_token_accuracy": 0.9675347328186035,
"num_tokens": 6095752.0,
"step": 65
},
{
"epoch": 0.06294964028776978,
"grad_norm": 0.6183492541313171,
"learning_rate": 1.4548766332187261e-05,
"loss": 0.0997,
"mean_token_accuracy": 0.9645833373069763,
"num_tokens": 6568280.0,
"step": 70
},
{
"epoch": 0.06744604316546762,
"grad_norm": 0.5590345859527588,
"learning_rate": 1.4546715534359241e-05,
"loss": 0.0973,
"mean_token_accuracy": 0.964062511920929,
"num_tokens": 7039631.0,
"step": 75
},
{
"epoch": 0.07194244604316546,
"grad_norm": 0.5744739770889282,
"learning_rate": 1.4544384117542591e-05,
"loss": 0.1004,
"mean_token_accuracy": 0.965625011920929,
"num_tokens": 7507809.0,
"step": 80
},
{
"epoch": 0.0764388489208633,
"grad_norm": 0.4603578448295593,
"learning_rate": 1.4541772201788454e-05,
"loss": 0.0963,
"mean_token_accuracy": 0.9656250238418579,
"num_tokens": 7975490.0,
"step": 85
},
{
"epoch": 0.08093525179856115,
"grad_norm": 0.47225049138069153,
"learning_rate": 1.453887992159164e-05,
"loss": 0.0948,
"mean_token_accuracy": 0.9659722328186036,
"num_tokens": 8445461.0,
"step": 90
},
{
"epoch": 0.08543165467625899,
"grad_norm": 0.47965773940086365,
"learning_rate": 1.453570742588371e-05,
"loss": 0.0972,
"mean_token_accuracy": 0.9663194417953491,
"num_tokens": 8912561.0,
"step": 95
},
{
"epoch": 0.08992805755395683,
"grad_norm": 0.5365564823150635,
"learning_rate": 1.4532254878025292e-05,
"loss": 0.0998,
"mean_token_accuracy": 0.9631944537162781,
"num_tokens": 9382565.0,
"step": 100
},
{
"epoch": 0.09442446043165467,
"grad_norm": 0.522896409034729,
"learning_rate": 1.4528522455797692e-05,
"loss": 0.0962,
"mean_token_accuracy": 0.964062511920929,
"num_tokens": 9851148.0,
"step": 105
},
{
"epoch": 0.09892086330935251,
"grad_norm": 0.48392146825790405,
"learning_rate": 1.4524510351393716e-05,
"loss": 0.0915,
"mean_token_accuracy": 0.9649305582046509,
"num_tokens": 10318813.0,
"step": 110
},
{
"epoch": 0.10341726618705036,
"grad_norm": 0.42742612957954407,
"learning_rate": 1.4520218771407784e-05,
"loss": 0.0968,
"mean_token_accuracy": 0.9649305582046509,
"num_tokens": 10785036.0,
"step": 115
},
{
"epoch": 0.1079136690647482,
"grad_norm": 0.3914225995540619,
"learning_rate": 1.4515647936825296e-05,
"loss": 0.0967,
"mean_token_accuracy": 0.964062511920929,
"num_tokens": 11253858.0,
"step": 120
},
{
"epoch": 0.11241007194244604,
"grad_norm": 0.4432506263256073,
"learning_rate": 1.451079808301125e-05,
"loss": 0.0985,
"mean_token_accuracy": 0.9640625238418579,
"num_tokens": 11722148.0,
"step": 125
},
{
"epoch": 0.11690647482014388,
"grad_norm": 0.5651817917823792,
"learning_rate": 1.4505669459698112e-05,
"loss": 0.0937,
"mean_token_accuracy": 0.9680555820465088,
"num_tokens": 12192766.0,
"step": 130
},
{
"epoch": 0.12140287769784172,
"grad_norm": 0.46366673707962036,
"learning_rate": 1.4500262330972978e-05,
"loss": 0.0912,
"mean_token_accuracy": 0.9659722208976745,
"num_tokens": 12660483.0,
"step": 135
},
{
"epoch": 0.12589928057553956,
"grad_norm": 0.42186692357063293,
"learning_rate": 1.4494576975263952e-05,
"loss": 0.0962,
"mean_token_accuracy": 0.9659722208976745,
"num_tokens": 13127525.0,
"step": 140
},
{
"epoch": 0.1303956834532374,
"grad_norm": 0.3628046214580536,
"learning_rate": 1.448861368532582e-05,
"loss": 0.0979,
"mean_token_accuracy": 0.9630208373069763,
"num_tokens": 13596548.0,
"step": 145
},
{
"epoch": 0.13489208633093525,
"grad_norm": 0.39447155594825745,
"learning_rate": 1.4482372768224984e-05,
"loss": 0.0953,
"mean_token_accuracy": 0.9638889074325562,
"num_tokens": 14065589.0,
"step": 150
},
{
"epoch": 0.1393884892086331,
"grad_norm": 0.41298848390579224,
"learning_rate": 1.4475854545323637e-05,
"loss": 0.0978,
"mean_token_accuracy": 0.9649305582046509,
"num_tokens": 14534593.0,
"step": 155
},
{
"epoch": 0.14388489208633093,
"grad_norm": 0.5090773701667786,
"learning_rate": 1.4469059352263213e-05,
"loss": 0.092,
"mean_token_accuracy": 0.9671875238418579,
"num_tokens": 15004794.0,
"step": 160
},
{
"epoch": 0.14838129496402877,
"grad_norm": 0.5376242995262146,
"learning_rate": 1.4461987538947123e-05,
"loss": 0.0965,
"mean_token_accuracy": 0.9642361283302308,
"num_tokens": 15472592.0,
"step": 165
},
{
"epoch": 0.1528776978417266,
"grad_norm": 0.5043388605117798,
"learning_rate": 1.445463946952271e-05,
"loss": 0.09,
"mean_token_accuracy": 0.9692708492279053,
"num_tokens": 15940501.0,
"step": 170
},
{
"epoch": 0.15737410071942445,
"grad_norm": 0.49153539538383484,
"learning_rate": 1.4447015522362527e-05,
"loss": 0.0953,
"mean_token_accuracy": 0.9645833611488343,
"num_tokens": 16409778.0,
"step": 175
},
{
"epoch": 0.1618705035971223,
"grad_norm": 0.5271637439727783,
"learning_rate": 1.4439116090044831e-05,
"loss": 0.0937,
"mean_token_accuracy": 0.9659722447395325,
"num_tokens": 16880259.0,
"step": 180
},
{
"epoch": 0.16636690647482014,
"grad_norm": 0.4684729278087616,
"learning_rate": 1.4430941579333378e-05,
"loss": 0.0906,
"mean_token_accuracy": 0.9690972328186035,
"num_tokens": 17349465.0,
"step": 185
},
{
"epoch": 0.17086330935251798,
"grad_norm": 0.4850688874721527,
"learning_rate": 1.442249241115648e-05,
"loss": 0.0902,
"mean_token_accuracy": 0.9680555701255799,
"num_tokens": 17816904.0,
"step": 190
},
{
"epoch": 0.17535971223021582,
"grad_norm": 0.44540664553642273,
"learning_rate": 1.4413769020585319e-05,
"loss": 0.0819,
"mean_token_accuracy": 0.9680555701255799,
"num_tokens": 18284016.0,
"step": 195
},
{
"epoch": 0.17985611510791366,
"grad_norm": 0.5207117199897766,
"learning_rate": 1.4404771856811558e-05,
"loss": 0.0879,
"mean_token_accuracy": 0.9677083373069764,
"num_tokens": 18751285.0,
"step": 200
},
{
"epoch": 0.1843525179856115,
"grad_norm": 0.4022666811943054,
"learning_rate": 1.4395501383124202e-05,
"loss": 0.0861,
"mean_token_accuracy": 0.9689236164093018,
"num_tokens": 19219382.0,
"step": 205
},
{
"epoch": 0.18884892086330934,
"grad_norm": 0.4309217631816864,
"learning_rate": 1.4385958076885744e-05,
"loss": 0.0959,
"mean_token_accuracy": 0.9657986283302307,
"num_tokens": 19689263.0,
"step": 210
},
{
"epoch": 0.19334532374100719,
"grad_norm": 0.47961878776550293,
"learning_rate": 1.4376142429507583e-05,
"loss": 0.0935,
"mean_token_accuracy": 0.9659722208976745,
"num_tokens": 20159528.0,
"step": 215
},
{
"epoch": 0.19784172661870503,
"grad_norm": 0.688991904258728,
"learning_rate": 1.4366054946424724e-05,
"loss": 0.0906,
"mean_token_accuracy": 0.9696180582046509,
"num_tokens": 20630783.0,
"step": 220
},
{
"epoch": 0.20233812949640287,
"grad_norm": 0.4284147620201111,
"learning_rate": 1.4355696147069747e-05,
"loss": 0.0879,
"mean_token_accuracy": 0.9678819656372071,
"num_tokens": 21097847.0,
"step": 225
},
{
"epoch": 0.2068345323741007,
"grad_norm": 0.43436649441719055,
"learning_rate": 1.4345066564846065e-05,
"loss": 0.0982,
"mean_token_accuracy": 0.9640625,
"num_tokens": 21568414.0,
"step": 230
},
{
"epoch": 0.21133093525179855,
"grad_norm": 0.4775388836860657,
"learning_rate": 1.4334166747100448e-05,
"loss": 0.0864,
"mean_token_accuracy": 0.9689236164093018,
"num_tokens": 22038261.0,
"step": 235
},
{
"epoch": 0.2158273381294964,
"grad_norm": 0.4478053152561188,
"learning_rate": 1.4322997255094853e-05,
"loss": 0.0915,
"mean_token_accuracy": 0.9663194417953491,
"num_tokens": 22507928.0,
"step": 240
},
{
"epoch": 0.22032374100719423,
"grad_norm": 0.5618180632591248,
"learning_rate": 1.4311558663977512e-05,
"loss": 0.0948,
"mean_token_accuracy": 0.9670138955116272,
"num_tokens": 22977356.0,
"step": 245
},
{
"epoch": 0.22482014388489208,
"grad_norm": 0.45267704129219055,
"learning_rate": 1.4299851562753316e-05,
"loss": 0.0939,
"mean_token_accuracy": 0.9675347447395325,
"num_tokens": 23445012.0,
"step": 250
},
{
"epoch": 0.22931654676258992,
"grad_norm": 0.4265112578868866,
"learning_rate": 1.4287876554253494e-05,
"loss": 0.0923,
"mean_token_accuracy": 0.9666666746139526,
"num_tokens": 23918138.0,
"step": 255
},
{
"epoch": 0.23381294964028776,
"grad_norm": 0.46962136030197144,
"learning_rate": 1.4275634255104564e-05,
"loss": 0.0903,
"mean_token_accuracy": 0.9654513955116272,
"num_tokens": 24389671.0,
"step": 260
},
{
"epoch": 0.2383093525179856,
"grad_norm": 0.3906201720237732,
"learning_rate": 1.4263125295696585e-05,
"loss": 0.0854,
"mean_token_accuracy": 0.9684027791023254,
"num_tokens": 24862914.0,
"step": 265
},
{
"epoch": 0.24280575539568344,
"grad_norm": 0.4527030289173126,
"learning_rate": 1.4250350320150692e-05,
"loss": 0.089,
"mean_token_accuracy": 0.9682291626930237,
"num_tokens": 25331420.0,
"step": 270
},
{
"epoch": 0.24730215827338128,
"grad_norm": 0.40908169746398926,
"learning_rate": 1.4237309986285931e-05,
"loss": 0.0876,
"mean_token_accuracy": 0.9682291626930237,
"num_tokens": 25799898.0,
"step": 275
},
{
"epoch": 0.2517985611510791,
"grad_norm": 0.4546169638633728,
"learning_rate": 1.422400496558539e-05,
"loss": 0.0875,
"mean_token_accuracy": 0.9692708253860474,
"num_tokens": 26272817.0,
"step": 280
},
{
"epoch": 0.256294964028777,
"grad_norm": 0.4130357503890991,
"learning_rate": 1.4210435943161616e-05,
"loss": 0.0903,
"mean_token_accuracy": 0.9682291746139526,
"num_tokens": 26740515.0,
"step": 285
},
{
"epoch": 0.2607913669064748,
"grad_norm": 0.4100114405155182,
"learning_rate": 1.4196603617721347e-05,
"loss": 0.0901,
"mean_token_accuracy": 0.9684027910232544,
"num_tokens": 27210026.0,
"step": 290
},
{
"epoch": 0.2652877697841727,
"grad_norm": 0.46927815675735474,
"learning_rate": 1.4182508701529513e-05,
"loss": 0.0839,
"mean_token_accuracy": 0.9690972447395325,
"num_tokens": 27678965.0,
"step": 295
},
{
"epoch": 0.2697841726618705,
"grad_norm": 0.4076975882053375,
"learning_rate": 1.4168151920372579e-05,
"loss": 0.0821,
"mean_token_accuracy": 0.969444465637207,
"num_tokens": 28149371.0,
"step": 300
},
{
"epoch": 0.27428057553956836,
"grad_norm": 0.36228322982788086,
"learning_rate": 1.415353401352117e-05,
"loss": 0.088,
"mean_token_accuracy": 0.9684027791023254,
"num_tokens": 28614761.0,
"step": 305
},
{
"epoch": 0.2787769784172662,
"grad_norm": 0.4045368731021881,
"learning_rate": 1.4138655733691993e-05,
"loss": 0.0876,
"mean_token_accuracy": 0.9696180582046509,
"num_tokens": 29084694.0,
"step": 310
},
{
"epoch": 0.28327338129496404,
"grad_norm": 0.41623398661613464,
"learning_rate": 1.4123517847009096e-05,
"loss": 0.0812,
"mean_token_accuracy": 0.970312488079071,
"num_tokens": 29554086.0,
"step": 315
},
{
"epoch": 0.28776978417266186,
"grad_norm": 0.4583008289337158,
"learning_rate": 1.4108121132964388e-05,
"loss": 0.0883,
"mean_token_accuracy": 0.9680555582046508,
"num_tokens": 30024350.0,
"step": 320
},
{
"epoch": 0.2922661870503597,
"grad_norm": 0.4604341685771942,
"learning_rate": 1.4092466384377532e-05,
"loss": 0.0791,
"mean_token_accuracy": 0.971006965637207,
"num_tokens": 30491759.0,
"step": 325
},
{
"epoch": 0.29676258992805754,
"grad_norm": 0.4965105950832367,
"learning_rate": 1.4076554407355108e-05,
"loss": 0.0854,
"mean_token_accuracy": 0.9703125,
"num_tokens": 30959969.0,
"step": 330
},
{
"epoch": 0.3012589928057554,
"grad_norm": 0.36111050844192505,
"learning_rate": 1.4060386021249099e-05,
"loss": 0.0844,
"mean_token_accuracy": 0.9715278029441834,
"num_tokens": 31430407.0,
"step": 335
},
{
"epoch": 0.3057553956834532,
"grad_norm": 0.4066219925880432,
"learning_rate": 1.4043962058614708e-05,
"loss": 0.0788,
"mean_token_accuracy": 0.9732638835906983,
"num_tokens": 31900742.0,
"step": 340
},
{
"epoch": 0.3102517985611511,
"grad_norm": 0.40719839930534363,
"learning_rate": 1.4027283365167485e-05,
"loss": 0.0951,
"mean_token_accuracy": 0.9659722328186036,
"num_tokens": 32373021.0,
"step": 345
},
{
"epoch": 0.3147482014388489,
"grad_norm": 0.46199360489845276,
"learning_rate": 1.401035079973978e-05,
"loss": 0.0883,
"mean_token_accuracy": 0.9671875,
"num_tokens": 32840444.0,
"step": 350
},
{
"epoch": 0.3192446043165468,
"grad_norm": 0.5061129331588745,
"learning_rate": 1.399316523423651e-05,
"loss": 0.0906,
"mean_token_accuracy": 0.9661458492279053,
"num_tokens": 33311175.0,
"step": 355
},
{
"epoch": 0.3237410071942446,
"grad_norm": 0.39469435811042786,
"learning_rate": 1.397572755359028e-05,
"loss": 0.0879,
"mean_token_accuracy": 0.9696180582046509,
"num_tokens": 33781258.0,
"step": 360
},
{
"epoch": 0.32823741007194246,
"grad_norm": 0.39724910259246826,
"learning_rate": 1.39580386557158e-05,
"loss": 0.0872,
"mean_token_accuracy": 0.9685764074325561,
"num_tokens": 34250531.0,
"step": 365
},
{
"epoch": 0.3327338129496403,
"grad_norm": 0.45710304379463196,
"learning_rate": 1.3940099451463658e-05,
"loss": 0.0855,
"mean_token_accuracy": 0.9699652791023254,
"num_tokens": 34720407.0,
"step": 370
},
{
"epoch": 0.33723021582733814,
"grad_norm": 0.45646730065345764,
"learning_rate": 1.392191086457341e-05,
"loss": 0.0785,
"mean_token_accuracy": 0.9746527910232544,
"num_tokens": 35186721.0,
"step": 375
},
{
"epoch": 0.34172661870503596,
"grad_norm": 0.4192124605178833,
"learning_rate": 1.3903473831626019e-05,
"loss": 0.0891,
"mean_token_accuracy": 0.9710069537162781,
"num_tokens": 35654890.0,
"step": 380
},
{
"epoch": 0.3462230215827338,
"grad_norm": 0.394729346036911,
"learning_rate": 1.388478930199563e-05,
"loss": 0.0872,
"mean_token_accuracy": 0.9710069298744202,
"num_tokens": 36124738.0,
"step": 385
},
{
"epoch": 0.35071942446043164,
"grad_norm": 0.33801376819610596,
"learning_rate": 1.3865858237800677e-05,
"loss": 0.085,
"mean_token_accuracy": 0.9694444537162781,
"num_tokens": 36592823.0,
"step": 390
},
{
"epoch": 0.3552158273381295,
"grad_norm": 0.36717891693115234,
"learning_rate": 1.3846681613854347e-05,
"loss": 0.0852,
"mean_token_accuracy": 0.9701388835906982,
"num_tokens": 37060806.0,
"step": 395
},
{
"epoch": 0.3597122302158273,
"grad_norm": 0.41675055027008057,
"learning_rate": 1.3827260417614385e-05,
"loss": 0.0864,
"mean_token_accuracy": 0.9703125119209289,
"num_tokens": 37533546.0,
"step": 400
},
{
"epoch": 0.3642086330935252,
"grad_norm": 0.5478615760803223,
"learning_rate": 1.3807595649132233e-05,
"loss": 0.0856,
"mean_token_accuracy": 0.9692708373069763,
"num_tokens": 38003799.0,
"step": 405
},
{
"epoch": 0.368705035971223,
"grad_norm": 0.35957762598991394,
"learning_rate": 1.3787688321001566e-05,
"loss": 0.0816,
"mean_token_accuracy": 0.9704861164093017,
"num_tokens": 38473226.0,
"step": 410
},
{
"epoch": 0.3732014388489209,
"grad_norm": 0.4207388758659363,
"learning_rate": 1.3767539458306107e-05,
"loss": 0.0872,
"mean_token_accuracy": 0.9694444417953492,
"num_tokens": 38942060.0,
"step": 415
},
{
"epoch": 0.3776978417266187,
"grad_norm": 0.34111288189888,
"learning_rate": 1.3747150098566884e-05,
"loss": 0.0887,
"mean_token_accuracy": 0.9689236164093018,
"num_tokens": 39412384.0,
"step": 420
},
{
"epoch": 0.38219424460431656,
"grad_norm": 0.3971599340438843,
"learning_rate": 1.3726521291688778e-05,
"loss": 0.0892,
"mean_token_accuracy": 0.9678819656372071,
"num_tokens": 39883643.0,
"step": 425
},
{
"epoch": 0.38669064748201437,
"grad_norm": 0.3130061626434326,
"learning_rate": 1.3705654099906471e-05,
"loss": 0.0809,
"mean_token_accuracy": 0.9723958373069763,
"num_tokens": 40353746.0,
"step": 430
},
{
"epoch": 0.39118705035971224,
"grad_norm": 0.4201053977012634,
"learning_rate": 1.368454959772975e-05,
"loss": 0.084,
"mean_token_accuracy": 0.9708333492279053,
"num_tokens": 40825196.0,
"step": 435
},
{
"epoch": 0.39568345323741005,
"grad_norm": 0.41213706135749817,
"learning_rate": 1.366320887188817e-05,
"loss": 0.0911,
"mean_token_accuracy": 0.9704861164093017,
"num_tokens": 41294879.0,
"step": 440
},
{
"epoch": 0.4001798561151079,
"grad_norm": 0.38970908522605896,
"learning_rate": 1.3641633021275108e-05,
"loss": 0.0852,
"mean_token_accuracy": 0.9677083492279053,
"num_tokens": 41762397.0,
"step": 445
},
{
"epoch": 0.40467625899280574,
"grad_norm": 0.3463442921638489,
"learning_rate": 1.361982315689116e-05,
"loss": 0.0804,
"mean_token_accuracy": 0.9704861283302307,
"num_tokens": 42229511.0,
"step": 450
},
{
"epoch": 0.4091726618705036,
"grad_norm": 0.32913315296173096,
"learning_rate": 1.3597780401786952e-05,
"loss": 0.0872,
"mean_token_accuracy": 0.9701388835906982,
"num_tokens": 42697235.0,
"step": 455
},
{
"epoch": 0.4136690647482014,
"grad_norm": 0.44308772683143616,
"learning_rate": 1.3575505891005293e-05,
"loss": 0.0769,
"mean_token_accuracy": 0.9710069417953491,
"num_tokens": 43162193.0,
"step": 460
},
{
"epoch": 0.4181654676258993,
"grad_norm": 0.42118602991104126,
"learning_rate": 1.355300077152274e-05,
"loss": 0.0874,
"mean_token_accuracy": 0.9685763716697693,
"num_tokens": 43632286.0,
"step": 465
},
{
"epoch": 0.4226618705035971,
"grad_norm": 0.3417890965938568,
"learning_rate": 1.3530266202190536e-05,
"loss": 0.0818,
"mean_token_accuracy": 0.9715277791023255,
"num_tokens": 44100455.0,
"step": 470
},
{
"epoch": 0.427158273381295,
"grad_norm": 0.3577599823474884,
"learning_rate": 1.3507303353674935e-05,
"loss": 0.0855,
"mean_token_accuracy": 0.9692708492279053,
"num_tokens": 44569998.0,
"step": 475
},
{
"epoch": 0.4316546762589928,
"grad_norm": 0.34517139196395874,
"learning_rate": 1.348411340839692e-05,
"loss": 0.0907,
"mean_token_accuracy": 0.9680555462837219,
"num_tokens": 45039376.0,
"step": 480
},
{
"epoch": 0.43615107913669066,
"grad_norm": 0.46521875262260437,
"learning_rate": 1.3460697560471315e-05,
"loss": 0.0833,
"mean_token_accuracy": 0.9710069417953491,
"num_tokens": 45507862.0,
"step": 485
},
{
"epoch": 0.44064748201438847,
"grad_norm": 0.5018951296806335,
"learning_rate": 1.3437057015645308e-05,
"loss": 0.083,
"mean_token_accuracy": 0.9689236164093018,
"num_tokens": 45977282.0,
"step": 490
},
{
"epoch": 0.44514388489208634,
"grad_norm": 0.37957438826560974,
"learning_rate": 1.341319299123635e-05,
"loss": 0.0792,
"mean_token_accuracy": 0.9710069417953491,
"num_tokens": 46441970.0,
"step": 495
},
{
"epoch": 0.44964028776978415,
"grad_norm": 0.4474797248840332,
"learning_rate": 1.3389106716069478e-05,
"loss": 0.0798,
"mean_token_accuracy": 0.971875,
"num_tokens": 46912092.0,
"step": 500
},
{
"epoch": 0.454136690647482,
"grad_norm": 0.423255980014801,
"learning_rate": 1.3364799430414044e-05,
"loss": 0.0834,
"mean_token_accuracy": 0.9720486164093017,
"num_tokens": 47381568.0,
"step": 505
},
{
"epoch": 0.45863309352517984,
"grad_norm": 0.33100345730781555,
"learning_rate": 1.3340272385919837e-05,
"loss": 0.0803,
"mean_token_accuracy": 0.9711805582046509,
"num_tokens": 47848779.0,
"step": 510
},
{
"epoch": 0.4631294964028777,
"grad_norm": 0.4213719367980957,
"learning_rate": 1.3315526845552651e-05,
"loss": 0.0832,
"mean_token_accuracy": 0.9704861164093017,
"num_tokens": 48318817.0,
"step": 515
},
{
"epoch": 0.4676258992805755,
"grad_norm": 0.35615554451942444,
"learning_rate": 1.3290564083529227e-05,
"loss": 0.0847,
"mean_token_accuracy": 0.9685763955116272,
"num_tokens": 48786694.0,
"step": 520
},
{
"epoch": 0.4721223021582734,
"grad_norm": 0.35342615842819214,
"learning_rate": 1.326538538525167e-05,
"loss": 0.0802,
"mean_token_accuracy": 0.9671875,
"num_tokens": 49254590.0,
"step": 525
},
{
"epoch": 0.4766187050359712,
"grad_norm": 0.3581298291683197,
"learning_rate": 1.3239992047241228e-05,
"loss": 0.0821,
"mean_token_accuracy": 0.9699652791023254,
"num_tokens": 49726301.0,
"step": 530
},
{
"epoch": 0.48111510791366907,
"grad_norm": 0.3920028507709503,
"learning_rate": 1.3214385377071554e-05,
"loss": 0.0776,
"mean_token_accuracy": 0.9711805701255798,
"num_tokens": 50195878.0,
"step": 535
},
{
"epoch": 0.4856115107913669,
"grad_norm": 0.3756016790866852,
"learning_rate": 1.3188566693301371e-05,
"loss": 0.0874,
"mean_token_accuracy": 0.9678819417953491,
"num_tokens": 50668008.0,
"step": 540
},
{
"epoch": 0.49010791366906475,
"grad_norm": 0.3724729120731354,
"learning_rate": 1.3162537325406566e-05,
"loss": 0.0861,
"mean_token_accuracy": 0.9678819417953491,
"num_tokens": 51134853.0,
"step": 545
},
{
"epoch": 0.49460431654676257,
"grad_norm": 0.39227744936943054,
"learning_rate": 1.313629861371174e-05,
"loss": 0.0871,
"mean_token_accuracy": 0.9685764074325561,
"num_tokens": 51605543.0,
"step": 550
},
{
"epoch": 0.49910071942446044,
"grad_norm": 0.3155370056629181,
"learning_rate": 1.310985190932119e-05,
"loss": 0.0758,
"mean_token_accuracy": 0.9730902671813965,
"num_tokens": 52071731.0,
"step": 555
},
{
"epoch": 0.5035971223021583,
"grad_norm": 0.4646400511264801,
"learning_rate": 1.3083198574049334e-05,
"loss": 0.0802,
"mean_token_accuracy": 0.9692708373069763,
"num_tokens": 52540868.0,
"step": 560
},
{
"epoch": 0.5080935251798561,
"grad_norm": 0.5570467114448547,
"learning_rate": 1.305633998035059e-05,
"loss": 0.0799,
"mean_token_accuracy": 0.9722222208976745,
"num_tokens": 53006734.0,
"step": 565
},
{
"epoch": 0.512589928057554,
"grad_norm": 0.4304635524749756,
"learning_rate": 1.3029277511248705e-05,
"loss": 0.0797,
"mean_token_accuracy": 0.9722222447395324,
"num_tokens": 53477238.0,
"step": 570
},
{
"epoch": 0.5170863309352518,
"grad_norm": 0.39134058356285095,
"learning_rate": 1.3002012560265538e-05,
"loss": 0.0776,
"mean_token_accuracy": 0.9729166746139526,
"num_tokens": 53944632.0,
"step": 575
},
{
"epoch": 0.5215827338129496,
"grad_norm": 0.37532541155815125,
"learning_rate": 1.2974546531349302e-05,
"loss": 0.0812,
"mean_token_accuracy": 0.9713541746139527,
"num_tokens": 54413657.0,
"step": 580
},
{
"epoch": 0.5260791366906474,
"grad_norm": 0.43509700894355774,
"learning_rate": 1.294688083880227e-05,
"loss": 0.088,
"mean_token_accuracy": 0.9684027910232544,
"num_tokens": 54882059.0,
"step": 585
},
{
"epoch": 0.5305755395683454,
"grad_norm": 0.3687283396720886,
"learning_rate": 1.2919016907207958e-05,
"loss": 0.0782,
"mean_token_accuracy": 0.9723958492279052,
"num_tokens": 55352248.0,
"step": 590
},
{
"epoch": 0.5350719424460432,
"grad_norm": 0.30725207924842834,
"learning_rate": 1.2890956171357757e-05,
"loss": 0.0832,
"mean_token_accuracy": 0.9715277910232544,
"num_tokens": 55821249.0,
"step": 595
},
{
"epoch": 0.539568345323741,
"grad_norm": 0.33535632491111755,
"learning_rate": 1.2862700076177056e-05,
"loss": 0.086,
"mean_token_accuracy": 0.9697916746139527,
"num_tokens": 56292110.0,
"step": 600
},
{
"epoch": 0.5440647482014388,
"grad_norm": 0.320467084646225,
"learning_rate": 1.2834250076650847e-05,
"loss": 0.0835,
"mean_token_accuracy": 0.9694444537162781,
"num_tokens": 56758533.0,
"step": 605
},
{
"epoch": 0.5485611510791367,
"grad_norm": 0.31769710779190063,
"learning_rate": 1.2805607637748786e-05,
"loss": 0.0873,
"mean_token_accuracy": 0.9689236164093018,
"num_tokens": 57229675.0,
"step": 610
},
{
"epoch": 0.5530575539568345,
"grad_norm": 0.468817800283432,
"learning_rate": 1.2776774234349778e-05,
"loss": 0.0813,
"mean_token_accuracy": 0.9723958373069763,
"num_tokens": 57697738.0,
"step": 615
},
{
"epoch": 0.5575539568345323,
"grad_norm": 0.36219796538352966,
"learning_rate": 1.2747751351166015e-05,
"loss": 0.0885,
"mean_token_accuracy": 0.9684027910232544,
"num_tokens": 58164798.0,
"step": 620
},
{
"epoch": 0.5620503597122302,
"grad_norm": 0.34549543261528015,
"learning_rate": 1.271854048266653e-05,
"loss": 0.0866,
"mean_token_accuracy": 0.9701388835906982,
"num_tokens": 58636586.0,
"step": 625
},
{
"epoch": 0.5665467625899281,
"grad_norm": 0.33623769879341125,
"learning_rate": 1.2689143133000252e-05,
"loss": 0.0881,
"mean_token_accuracy": 0.9687500119209289,
"num_tokens": 59106342.0,
"step": 630
},
{
"epoch": 0.5710431654676259,
"grad_norm": 0.3239581286907196,
"learning_rate": 1.2659560815918532e-05,
"loss": 0.0809,
"mean_token_accuracy": 0.9708333373069763,
"num_tokens": 59573612.0,
"step": 635
},
{
"epoch": 0.5755395683453237,
"grad_norm": 0.37120115756988525,
"learning_rate": 1.2629795054697216e-05,
"loss": 0.0849,
"mean_token_accuracy": 0.9715277552604675,
"num_tokens": 60043487.0,
"step": 640
},
{
"epoch": 0.5800359712230215,
"grad_norm": 0.40190795063972473,
"learning_rate": 1.2599847382058198e-05,
"loss": 0.0833,
"mean_token_accuracy": 0.969444465637207,
"num_tokens": 60511760.0,
"step": 645
},
{
"epoch": 0.5845323741007195,
"grad_norm": 0.3242078423500061,
"learning_rate": 1.2569719340090496e-05,
"loss": 0.0839,
"mean_token_accuracy": 0.9699652791023254,
"num_tokens": 60979675.0,
"step": 650
},
{
"epoch": 0.5890287769784173,
"grad_norm": 0.32616937160491943,
"learning_rate": 1.2539412480170847e-05,
"loss": 0.0839,
"mean_token_accuracy": 0.9699652910232544,
"num_tokens": 61444272.0,
"step": 655
},
{
"epoch": 0.5935251798561151,
"grad_norm": 0.3729708194732666,
"learning_rate": 1.2508928362883822e-05,
"loss": 0.0806,
"mean_token_accuracy": 0.9697916746139527,
"num_tokens": 61916908.0,
"step": 660
}
],
"logging_steps": 5,
"max_steps": 2224,
"num_input_tokens_seen": 0,
"num_train_epochs": 2,
"save_steps": 500,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": false
},
"attributes": {}
}
},
"total_flos": 3.2552287361354957e+18,
"train_batch_size": 32,
"trial_name": null,
"trial_params": null
}