YeMoKoo's picture
Add final checkpoint: trace_upstream_pre_order2
0e195de verified
Raw
History Blame Contribute Delete
60.7 kB
{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 3.0,
"eval_steps": 500,
"global_step": 237,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.012658227848101266,
"grad_norm": 7.577828407287598,
"learning_rate": 0.0,
"loss": 1.9571,
"mean_token_accuracy": 0.6694959402084351,
"num_tokens": 7722.0,
"step": 1
},
{
"epoch": 0.02531645569620253,
"grad_norm": 7.746953964233398,
"learning_rate": 2.5e-05,
"loss": 1.9398,
"mean_token_accuracy": 0.676712691783905,
"num_tokens": 15318.0,
"step": 2
},
{
"epoch": 0.0379746835443038,
"grad_norm": 4.52789831161499,
"learning_rate": 5e-05,
"loss": 1.7311,
"mean_token_accuracy": 0.6810978055000305,
"num_tokens": 23143.0,
"step": 3
},
{
"epoch": 0.05063291139240506,
"grad_norm": 2.9054675102233887,
"learning_rate": 7.500000000000001e-05,
"loss": 1.3154,
"mean_token_accuracy": 0.7156617045402527,
"num_tokens": 30786.0,
"step": 4
},
{
"epoch": 0.06329113924050633,
"grad_norm": 1.708419919013977,
"learning_rate": 0.0001,
"loss": 1.0543,
"mean_token_accuracy": 0.793462336063385,
"num_tokens": 38345.0,
"step": 5
},
{
"epoch": 0.0759493670886076,
"grad_norm": 4.625662326812744,
"learning_rate": 0.000125,
"loss": 0.8803,
"mean_token_accuracy": 0.8147608041763306,
"num_tokens": 45956.0,
"step": 6
},
{
"epoch": 0.08860759493670886,
"grad_norm": 11.903258323669434,
"learning_rate": 0.00015000000000000001,
"loss": 0.8083,
"mean_token_accuracy": 0.8231238126754761,
"num_tokens": 53562.0,
"step": 7
},
{
"epoch": 0.10126582278481013,
"grad_norm": 7.953157901763916,
"learning_rate": 0.000175,
"loss": 0.7792,
"mean_token_accuracy": 0.8260988593101501,
"num_tokens": 60929.0,
"step": 8
},
{
"epoch": 0.11392405063291139,
"grad_norm": 3.9451382160186768,
"learning_rate": 0.0002,
"loss": 0.7858,
"mean_token_accuracy": 0.8231524229049683,
"num_tokens": 68327.0,
"step": 9
},
{
"epoch": 0.12658227848101267,
"grad_norm": 7.63812780380249,
"learning_rate": 0.00019999058994907564,
"loss": 0.8194,
"mean_token_accuracy": 0.8158359527587891,
"num_tokens": 75754.0,
"step": 10
},
{
"epoch": 0.13924050632911392,
"grad_norm": 1.7502692937850952,
"learning_rate": 0.0001999623615672837,
"loss": 0.7591,
"mean_token_accuracy": 0.8333558440208435,
"num_tokens": 83217.0,
"step": 11
},
{
"epoch": 0.1518987341772152,
"grad_norm": 1.258649230003357,
"learning_rate": 0.00019991532016723439,
"loss": 0.7988,
"mean_token_accuracy": 0.8254917860031128,
"num_tokens": 90805.0,
"step": 12
},
{
"epoch": 0.16455696202531644,
"grad_norm": 0.4300090968608856,
"learning_rate": 0.00019984947460216707,
"loss": 0.7602,
"mean_token_accuracy": 0.8290643692016602,
"num_tokens": 98404.0,
"step": 13
},
{
"epoch": 0.17721518987341772,
"grad_norm": 6.66930627822876,
"learning_rate": 0.00019976483726428422,
"loss": 0.7419,
"mean_token_accuracy": 0.8308157324790955,
"num_tokens": 106081.0,
"step": 14
},
{
"epoch": 0.189873417721519,
"grad_norm": 0.6765839457511902,
"learning_rate": 0.00019966142408241901,
"loss": 0.8115,
"mean_token_accuracy": 0.8222697973251343,
"num_tokens": 113617.0,
"step": 15
},
{
"epoch": 0.20253164556962025,
"grad_norm": 5.244386672973633,
"learning_rate": 0.00019953925451903756,
"loss": 0.7769,
"mean_token_accuracy": 0.8213022351264954,
"num_tokens": 121314.0,
"step": 16
},
{
"epoch": 0.21518987341772153,
"grad_norm": 0.5631109476089478,
"learning_rate": 0.00019939835156657616,
"loss": 0.7315,
"mean_token_accuracy": 0.8379343748092651,
"num_tokens": 128659.0,
"step": 17
},
{
"epoch": 0.22784810126582278,
"grad_norm": 0.5312209129333496,
"learning_rate": 0.00019923874174311394,
"loss": 0.7124,
"mean_token_accuracy": 0.835067868232727,
"num_tokens": 136314.0,
"step": 18
},
{
"epoch": 0.24050632911392406,
"grad_norm": 0.664734423160553,
"learning_rate": 0.00019906045508738228,
"loss": 0.7232,
"mean_token_accuracy": 0.8314966559410095,
"num_tokens": 144182.0,
"step": 19
},
{
"epoch": 0.25316455696202533,
"grad_norm": 0.4895744025707245,
"learning_rate": 0.00019886352515311134,
"loss": 0.783,
"mean_token_accuracy": 0.8221429586410522,
"num_tokens": 152095.0,
"step": 20
},
{
"epoch": 0.26582278481012656,
"grad_norm": 0.7920514345169067,
"learning_rate": 0.00019864798900271532,
"loss": 0.7075,
"mean_token_accuracy": 0.8389923572540283,
"num_tokens": 159463.0,
"step": 21
},
{
"epoch": 0.27848101265822783,
"grad_norm": 0.8280817866325378,
"learning_rate": 0.00019841388720031727,
"loss": 0.6889,
"mean_token_accuracy": 0.8389334678649902,
"num_tokens": 166878.0,
"step": 22
},
{
"epoch": 0.2911392405063291,
"grad_norm": 0.38697078824043274,
"learning_rate": 0.00019816126380411476,
"loss": 0.673,
"mean_token_accuracy": 0.8453608155250549,
"num_tokens": 174314.0,
"step": 23
},
{
"epoch": 0.3037974683544304,
"grad_norm": 0.47077956795692444,
"learning_rate": 0.00019789016635808837,
"loss": 0.7354,
"mean_token_accuracy": 0.8276225328445435,
"num_tokens": 181966.0,
"step": 24
},
{
"epoch": 0.31645569620253167,
"grad_norm": 0.5773133039474487,
"learning_rate": 0.00019760064588305345,
"loss": 0.7412,
"mean_token_accuracy": 0.8243722915649414,
"num_tokens": 189637.0,
"step": 25
},
{
"epoch": 0.3291139240506329,
"grad_norm": 0.5629377961158752,
"learning_rate": 0.0001972927568670583,
"loss": 0.6763,
"mean_token_accuracy": 0.8467550873756409,
"num_tokens": 196866.0,
"step": 26
},
{
"epoch": 0.34177215189873417,
"grad_norm": 0.4058995544910431,
"learning_rate": 0.00019696655725512933,
"loss": 0.7035,
"mean_token_accuracy": 0.8346715569496155,
"num_tokens": 204527.0,
"step": 27
},
{
"epoch": 0.35443037974683544,
"grad_norm": 0.3507729172706604,
"learning_rate": 0.00019662210843836574,
"loss": 0.7462,
"mean_token_accuracy": 0.8278258442878723,
"num_tokens": 212217.0,
"step": 28
},
{
"epoch": 0.3670886075949367,
"grad_norm": 0.49514463543891907,
"learning_rate": 0.00019625947524238563,
"loss": 0.6374,
"mean_token_accuracy": 0.8493860960006714,
"num_tokens": 219611.0,
"step": 29
},
{
"epoch": 0.379746835443038,
"grad_norm": 0.5946100950241089,
"learning_rate": 0.0001958787259151258,
"loss": 0.6899,
"mean_token_accuracy": 0.8388254046440125,
"num_tokens": 227201.0,
"step": 30
},
{
"epoch": 0.3924050632911392,
"grad_norm": 0.5284402966499329,
"learning_rate": 0.0001954799321139975,
"loss": 0.6359,
"mean_token_accuracy": 0.849815845489502,
"num_tokens": 234596.0,
"step": 31
},
{
"epoch": 0.4050632911392405,
"grad_norm": 0.3717970848083496,
"learning_rate": 0.00019506316889240027,
"loss": 0.6561,
"mean_token_accuracy": 0.8414534330368042,
"num_tokens": 242008.0,
"step": 32
},
{
"epoch": 0.4177215189873418,
"grad_norm": 0.3561764061450958,
"learning_rate": 0.0001946285146855968,
"loss": 0.6832,
"mean_token_accuracy": 0.8376168012619019,
"num_tokens": 249776.0,
"step": 33
},
{
"epoch": 0.43037974683544306,
"grad_norm": 0.3912392854690552,
"learning_rate": 0.00019417605129595157,
"loss": 0.6688,
"mean_token_accuracy": 0.8432945609092712,
"num_tokens": 257319.0,
"step": 34
},
{
"epoch": 0.4430379746835443,
"grad_norm": 0.45518746972084045,
"learning_rate": 0.0001937058638775353,
"loss": 0.6252,
"mean_token_accuracy": 0.8525184392929077,
"num_tokens": 264828.0,
"step": 35
},
{
"epoch": 0.45569620253164556,
"grad_norm": 0.4275685250759125,
"learning_rate": 0.00019321804092009906,
"loss": 0.6196,
"mean_token_accuracy": 0.8575549721717834,
"num_tokens": 272172.0,
"step": 36
},
{
"epoch": 0.46835443037974683,
"grad_norm": 0.36319318413734436,
"learning_rate": 0.00019271267423242024,
"loss": 0.6789,
"mean_token_accuracy": 0.8397783041000366,
"num_tokens": 279813.0,
"step": 37
},
{
"epoch": 0.4810126582278481,
"grad_norm": 0.43757617473602295,
"learning_rate": 0.0001921898589250242,
"loss": 0.6371,
"mean_token_accuracy": 0.8450391888618469,
"num_tokens": 287537.0,
"step": 38
},
{
"epoch": 0.4936708860759494,
"grad_norm": 0.39345020055770874,
"learning_rate": 0.00019164969339228422,
"loss": 0.6252,
"mean_token_accuracy": 0.8488776087760925,
"num_tokens": 295085.0,
"step": 39
},
{
"epoch": 0.5063291139240507,
"grad_norm": 0.39008787274360657,
"learning_rate": 0.00019109227929390378,
"loss": 0.6749,
"mean_token_accuracy": 0.840212881565094,
"num_tokens": 302853.0,
"step": 40
},
{
"epoch": 0.5189873417721519,
"grad_norm": 0.40397143363952637,
"learning_rate": 0.00019051772153578389,
"loss": 0.6502,
"mean_token_accuracy": 0.843741774559021,
"num_tokens": 310507.0,
"step": 41
},
{
"epoch": 0.5316455696202531,
"grad_norm": 0.34576931595802307,
"learning_rate": 0.00018992612825027976,
"loss": 0.5663,
"mean_token_accuracy": 0.8624165654182434,
"num_tokens": 317912.0,
"step": 42
},
{
"epoch": 0.5443037974683544,
"grad_norm": 0.4292350113391876,
"learning_rate": 0.00018931761077585035,
"loss": 0.6421,
"mean_token_accuracy": 0.8521012663841248,
"num_tokens": 325400.0,
"step": 43
},
{
"epoch": 0.5569620253164557,
"grad_norm": 0.3893992602825165,
"learning_rate": 0.00018869228363610404,
"loss": 0.603,
"mean_token_accuracy": 0.8546313047409058,
"num_tokens": 333086.0,
"step": 44
},
{
"epoch": 0.569620253164557,
"grad_norm": 0.3626430928707123,
"learning_rate": 0.00018805026451824546,
"loss": 0.5504,
"mean_token_accuracy": 0.86698979139328,
"num_tokens": 340578.0,
"step": 45
},
{
"epoch": 0.5822784810126582,
"grad_norm": 0.4151477515697479,
"learning_rate": 0.00018739167425092644,
"loss": 0.6749,
"mean_token_accuracy": 0.8368580341339111,
"num_tokens": 348586.0,
"step": 46
},
{
"epoch": 0.5949367088607594,
"grad_norm": 0.3864465653896332,
"learning_rate": 0.00018671663678150607,
"loss": 0.5704,
"mean_token_accuracy": 0.8640350699424744,
"num_tokens": 356174.0,
"step": 47
},
{
"epoch": 0.6075949367088608,
"grad_norm": 0.43347352743148804,
"learning_rate": 0.0001860252791527236,
"loss": 0.5495,
"mean_token_accuracy": 0.8597859144210815,
"num_tokens": 363805.0,
"step": 48
},
{
"epoch": 0.620253164556962,
"grad_norm": 0.4836398661136627,
"learning_rate": 0.00018531773147878895,
"loss": 0.6308,
"mean_token_accuracy": 0.8539444208145142,
"num_tokens": 371462.0,
"step": 49
},
{
"epoch": 0.6329113924050633,
"grad_norm": 0.4612779915332794,
"learning_rate": 0.00018459412692089494,
"loss": 0.5884,
"mean_token_accuracy": 0.8596022725105286,
"num_tokens": 379019.0,
"step": 50
},
{
"epoch": 0.6455696202531646,
"grad_norm": 0.4270411431789398,
"learning_rate": 0.00018385460166215638,
"loss": 0.5495,
"mean_token_accuracy": 0.8687131404876709,
"num_tokens": 386380.0,
"step": 51
},
{
"epoch": 0.6582278481012658,
"grad_norm": 0.4124862849712372,
"learning_rate": 0.00018309929488198012,
"loss": 0.5931,
"mean_token_accuracy": 0.8600296378135681,
"num_tokens": 393867.0,
"step": 52
},
{
"epoch": 0.6708860759493671,
"grad_norm": 0.3761177361011505,
"learning_rate": 0.00018232834872987147,
"loss": 0.585,
"mean_token_accuracy": 0.863766610622406,
"num_tokens": 401609.0,
"step": 53
},
{
"epoch": 0.6835443037974683,
"grad_norm": 0.3798786699771881,
"learning_rate": 0.0001815419082986815,
"loss": 0.6038,
"mean_token_accuracy": 0.8549598455429077,
"num_tokens": 409264.0,
"step": 54
},
{
"epoch": 0.6962025316455697,
"grad_norm": 0.3858072757720947,
"learning_rate": 0.00018074012159730032,
"loss": 0.5424,
"mean_token_accuracy": 0.8691484928131104,
"num_tokens": 416527.0,
"step": 55
},
{
"epoch": 0.7088607594936709,
"grad_norm": 0.39073118567466736,
"learning_rate": 0.00017992313952280172,
"loss": 0.506,
"mean_token_accuracy": 0.8774666786193848,
"num_tokens": 424091.0,
"step": 56
},
{
"epoch": 0.7215189873417721,
"grad_norm": 0.4660295844078064,
"learning_rate": 0.00017909111583204422,
"loss": 0.5728,
"mean_token_accuracy": 0.8573468327522278,
"num_tokens": 431859.0,
"step": 57
},
{
"epoch": 0.7341772151898734,
"grad_norm": 0.45270058512687683,
"learning_rate": 0.0001782442071127338,
"loss": 0.5809,
"mean_token_accuracy": 0.8605116009712219,
"num_tokens": 439429.0,
"step": 58
},
{
"epoch": 0.7468354430379747,
"grad_norm": 0.44151806831359863,
"learning_rate": 0.00017738257275395404,
"loss": 0.6342,
"mean_token_accuracy": 0.8478041291236877,
"num_tokens": 447417.0,
"step": 59
},
{
"epoch": 0.759493670886076,
"grad_norm": 0.40675118565559387,
"learning_rate": 0.0001765063749161688,
"loss": 0.5878,
"mean_token_accuracy": 0.8633121848106384,
"num_tokens": 455053.0,
"step": 60
},
{
"epoch": 0.7721518987341772,
"grad_norm": 0.42426082491874695,
"learning_rate": 0.00017561577850070355,
"loss": 0.5056,
"mean_token_accuracy": 0.8747982978820801,
"num_tokens": 462553.0,
"step": 61
},
{
"epoch": 0.7848101265822784,
"grad_norm": 0.5047997832298279,
"learning_rate": 0.00017471095111871074,
"loss": 0.5386,
"mean_token_accuracy": 0.8677419424057007,
"num_tokens": 470057.0,
"step": 62
},
{
"epoch": 0.7974683544303798,
"grad_norm": 0.4321729242801666,
"learning_rate": 0.00017379206305962526,
"loss": 0.4742,
"mean_token_accuracy": 0.8855810165405273,
"num_tokens": 477410.0,
"step": 63
},
{
"epoch": 0.810126582278481,
"grad_norm": 0.43735846877098083,
"learning_rate": 0.00017285928725911562,
"loss": 0.5114,
"mean_token_accuracy": 0.8768270015716553,
"num_tokens": 485000.0,
"step": 64
},
{
"epoch": 0.8227848101265823,
"grad_norm": 0.4349932074546814,
"learning_rate": 0.00017191279926653761,
"loss": 0.4947,
"mean_token_accuracy": 0.8799254298210144,
"num_tokens": 492576.0,
"step": 65
},
{
"epoch": 0.8354430379746836,
"grad_norm": 0.46583646535873413,
"learning_rate": 0.00017095277721189528,
"loss": 0.5472,
"mean_token_accuracy": 0.8641451001167297,
"num_tokens": 500413.0,
"step": 66
},
{
"epoch": 0.8481012658227848,
"grad_norm": 0.4772394597530365,
"learning_rate": 0.00016997940177231722,
"loss": 0.5716,
"mean_token_accuracy": 0.8625654578208923,
"num_tokens": 508117.0,
"step": 67
},
{
"epoch": 0.8607594936708861,
"grad_norm": 0.47736912965774536,
"learning_rate": 0.00016899285613805246,
"loss": 0.5048,
"mean_token_accuracy": 0.8752148151397705,
"num_tokens": 515746.0,
"step": 68
},
{
"epoch": 0.8734177215189873,
"grad_norm": 0.4343780279159546,
"learning_rate": 0.00016799332597799413,
"loss": 0.4687,
"mean_token_accuracy": 0.8839372396469116,
"num_tokens": 523013.0,
"step": 69
},
{
"epoch": 0.8860759493670886,
"grad_norm": 0.44280242919921875,
"learning_rate": 0.0001669809994047364,
"loss": 0.4772,
"mean_token_accuracy": 0.8798643946647644,
"num_tokens": 530452.0,
"step": 70
},
{
"epoch": 0.8987341772151899,
"grad_norm": 0.4641714096069336,
"learning_rate": 0.00016595606693917142,
"loss": 0.4602,
"mean_token_accuracy": 0.8870418071746826,
"num_tokens": 537855.0,
"step": 71
},
{
"epoch": 0.9113924050632911,
"grad_norm": 0.48911163210868835,
"learning_rate": 0.00016491872147463306,
"loss": 0.5123,
"mean_token_accuracy": 0.8701679706573486,
"num_tokens": 545421.0,
"step": 72
},
{
"epoch": 0.9240506329113924,
"grad_norm": 0.43602073192596436,
"learning_rate": 0.00016386915824059427,
"loss": 0.4066,
"mean_token_accuracy": 0.8927801847457886,
"num_tokens": 552909.0,
"step": 73
},
{
"epoch": 0.9367088607594937,
"grad_norm": 0.48829028010368347,
"learning_rate": 0.00016280757476592466,
"loss": 0.4922,
"mean_token_accuracy": 0.8765687942504883,
"num_tokens": 560702.0,
"step": 74
},
{
"epoch": 0.9493670886075949,
"grad_norm": 0.47516176104545593,
"learning_rate": 0.00016173417084171536,
"loss": 0.4346,
"mean_token_accuracy": 0.8902259469032288,
"num_tokens": 568245.0,
"step": 75
},
{
"epoch": 0.9620253164556962,
"grad_norm": 0.49728158116340637,
"learning_rate": 0.0001606491484836782,
"loss": 0.4271,
"mean_token_accuracy": 0.8917593955993652,
"num_tokens": 575857.0,
"step": 76
},
{
"epoch": 0.9746835443037974,
"grad_norm": 0.46857449412345886,
"learning_rate": 0.00015955271189412598,
"loss": 0.4059,
"mean_token_accuracy": 0.8973404169082642,
"num_tokens": 583441.0,
"step": 77
},
{
"epoch": 0.9873417721518988,
"grad_norm": 0.49021583795547485,
"learning_rate": 0.00015844506742354164,
"loss": 0.4636,
"mean_token_accuracy": 0.8833048343658447,
"num_tokens": 591106.0,
"step": 78
},
{
"epoch": 1.0,
"grad_norm": 0.46990546584129333,
"learning_rate": 0.00015732642353174259,
"loss": 0.4786,
"mean_token_accuracy": 0.8784138560295105,
"num_tokens": 598786.0,
"step": 79
},
{
"epoch": 1.0126582278481013,
"grad_norm": 0.4664880633354187,
"learning_rate": 0.00015619699074864864,
"loss": 0.337,
"mean_token_accuracy": 0.9137563109397888,
"num_tokens": 606352.0,
"step": 80
},
{
"epoch": 1.0253164556962024,
"grad_norm": 0.51947021484375,
"learning_rate": 0.00015505698163465986,
"loss": 0.325,
"mean_token_accuracy": 0.9177552461624146,
"num_tokens": 613918.0,
"step": 81
},
{
"epoch": 1.0379746835443038,
"grad_norm": 0.6177846193313599,
"learning_rate": 0.00015390661074065256,
"loss": 0.2845,
"mean_token_accuracy": 0.9252744317054749,
"num_tokens": 621543.0,
"step": 82
},
{
"epoch": 1.0506329113924051,
"grad_norm": 0.6303501725196838,
"learning_rate": 0.00015274609456760073,
"loss": 0.3447,
"mean_token_accuracy": 0.9104577898979187,
"num_tokens": 629056.0,
"step": 83
},
{
"epoch": 1.0632911392405062,
"grad_norm": 0.4975242018699646,
"learning_rate": 0.00015157565152583002,
"loss": 0.2811,
"mean_token_accuracy": 0.9240351915359497,
"num_tokens": 636505.0,
"step": 84
},
{
"epoch": 1.0759493670886076,
"grad_norm": 0.4337922930717468,
"learning_rate": 0.00015039550189391298,
"loss": 0.2779,
"mean_token_accuracy": 0.9240472912788391,
"num_tokens": 644100.0,
"step": 85
},
{
"epoch": 1.0886075949367089,
"grad_norm": 0.4337831437587738,
"learning_rate": 0.0001492058677772123,
"loss": 0.2813,
"mean_token_accuracy": 0.9259702563285828,
"num_tokens": 651688.0,
"step": 86
},
{
"epoch": 1.1012658227848102,
"grad_norm": 0.5133988261222839,
"learning_rate": 0.00014800697306608044,
"loss": 0.3357,
"mean_token_accuracy": 0.9157242774963379,
"num_tokens": 659180.0,
"step": 87
},
{
"epoch": 1.1139240506329113,
"grad_norm": 0.5234411954879761,
"learning_rate": 0.00014679904339372302,
"loss": 0.3015,
"mean_token_accuracy": 0.9213018417358398,
"num_tokens": 666741.0,
"step": 88
},
{
"epoch": 1.1265822784810127,
"grad_norm": 0.48323073983192444,
"learning_rate": 0.0001455823060937347,
"loss": 0.2736,
"mean_token_accuracy": 0.9301171898841858,
"num_tokens": 674060.0,
"step": 89
},
{
"epoch": 1.139240506329114,
"grad_norm": 0.4819142520427704,
"learning_rate": 0.00014435699015731448,
"loss": 0.2829,
"mean_token_accuracy": 0.9262295365333557,
"num_tokens": 681566.0,
"step": 90
},
{
"epoch": 1.1518987341772151,
"grad_norm": 0.48243483901023865,
"learning_rate": 0.00014312332619016965,
"loss": 0.3003,
"mean_token_accuracy": 0.9243434071540833,
"num_tokens": 689283.0,
"step": 91
},
{
"epoch": 1.1645569620253164,
"grad_norm": 0.4841754734516144,
"learning_rate": 0.00014188154636911524,
"loss": 0.2976,
"mean_token_accuracy": 0.9215511679649353,
"num_tokens": 697212.0,
"step": 92
},
{
"epoch": 1.1772151898734178,
"grad_norm": 0.4778158962726593,
"learning_rate": 0.00014063188439837832,
"loss": 0.2755,
"mean_token_accuracy": 0.9268808960914612,
"num_tokens": 704839.0,
"step": 93
},
{
"epoch": 1.189873417721519,
"grad_norm": 0.5948532223701477,
"learning_rate": 0.0001393745754656146,
"loss": 0.2929,
"mean_token_accuracy": 0.9211409687995911,
"num_tokens": 712055.0,
"step": 94
},
{
"epoch": 1.2025316455696202,
"grad_norm": 0.4850385785102844,
"learning_rate": 0.00013810985619764572,
"loss": 0.2911,
"mean_token_accuracy": 0.9238942861557007,
"num_tokens": 719648.0,
"step": 95
},
{
"epoch": 1.2151898734177216,
"grad_norm": 0.46476173400878906,
"learning_rate": 0.00013683796461592604,
"loss": 0.2636,
"mean_token_accuracy": 0.930665910243988,
"num_tokens": 727010.0,
"step": 96
},
{
"epoch": 1.2278481012658227,
"grad_norm": 0.5223667025566101,
"learning_rate": 0.00013555914009174663,
"loss": 0.2572,
"mean_token_accuracy": 0.9288017153739929,
"num_tokens": 734518.0,
"step": 97
},
{
"epoch": 1.240506329113924,
"grad_norm": 0.4877527058124542,
"learning_rate": 0.00013427362330118543,
"loss": 0.2504,
"mean_token_accuracy": 0.9308496713638306,
"num_tokens": 742232.0,
"step": 98
},
{
"epoch": 1.2531645569620253,
"grad_norm": 0.6950773000717163,
"learning_rate": 0.00013298165617981172,
"loss": 0.3101,
"mean_token_accuracy": 0.9148434400558472,
"num_tokens": 749929.0,
"step": 99
},
{
"epoch": 1.2658227848101267,
"grad_norm": 0.44876712560653687,
"learning_rate": 0.0001316834818771535,
"loss": 0.2368,
"mean_token_accuracy": 0.9370440244674683,
"num_tokens": 757395.0,
"step": 100
},
{
"epoch": 1.2784810126582278,
"grad_norm": 0.4970650374889374,
"learning_rate": 0.00013037934471093682,
"loss": 0.2759,
"mean_token_accuracy": 0.9289446473121643,
"num_tokens": 765115.0,
"step": 101
},
{
"epoch": 1.2911392405063291,
"grad_norm": 0.4088219404220581,
"learning_rate": 0.00012906949012110456,
"loss": 0.2565,
"mean_token_accuracy": 0.9364038109779358,
"num_tokens": 772648.0,
"step": 102
},
{
"epoch": 1.3037974683544304,
"grad_norm": 0.4770132303237915,
"learning_rate": 0.00012775416462362457,
"loss": 0.2995,
"mean_token_accuracy": 0.9228748083114624,
"num_tokens": 780323.0,
"step": 103
},
{
"epoch": 1.3164556962025316,
"grad_norm": 0.4587569832801819,
"learning_rate": 0.00012643361576409516,
"loss": 0.261,
"mean_token_accuracy": 0.9282762408256531,
"num_tokens": 787888.0,
"step": 104
},
{
"epoch": 1.3291139240506329,
"grad_norm": 0.46888846158981323,
"learning_rate": 0.00012510809207115666,
"loss": 0.2697,
"mean_token_accuracy": 0.9307641386985779,
"num_tokens": 795477.0,
"step": 105
},
{
"epoch": 1.3417721518987342,
"grad_norm": 0.4652051627635956,
"learning_rate": 0.00012377784300971807,
"loss": 0.2347,
"mean_token_accuracy": 0.9410588145256042,
"num_tokens": 803040.0,
"step": 106
},
{
"epoch": 1.3544303797468356,
"grad_norm": 0.5084942579269409,
"learning_rate": 0.00012244311893400763,
"loss": 0.2555,
"mean_token_accuracy": 0.9363048672676086,
"num_tokens": 810687.0,
"step": 107
},
{
"epoch": 1.3670886075949367,
"grad_norm": 0.5197248458862305,
"learning_rate": 0.00012110417104045575,
"loss": 0.2333,
"mean_token_accuracy": 0.9379802942276001,
"num_tokens": 818168.0,
"step": 108
},
{
"epoch": 1.379746835443038,
"grad_norm": 0.5095017552375793,
"learning_rate": 0.00011976125132041974,
"loss": 0.2494,
"mean_token_accuracy": 0.9335058331489563,
"num_tokens": 825962.0,
"step": 109
},
{
"epoch": 1.3924050632911391,
"grad_norm": 0.4584541618824005,
"learning_rate": 0.00011841461251275867,
"loss": 0.2747,
"mean_token_accuracy": 0.9289917945861816,
"num_tokens": 833842.0,
"step": 110
},
{
"epoch": 1.4050632911392404,
"grad_norm": 0.4197942018508911,
"learning_rate": 0.0001170645080562676,
"loss": 0.2425,
"mean_token_accuracy": 0.9401321411132812,
"num_tokens": 841172.0,
"step": 111
},
{
"epoch": 1.4177215189873418,
"grad_norm": 0.4704379439353943,
"learning_rate": 0.00011571119204198037,
"loss": 0.2348,
"mean_token_accuracy": 0.9371610283851624,
"num_tokens": 848795.0,
"step": 112
},
{
"epoch": 1.4303797468354431,
"grad_norm": 0.47736111283302307,
"learning_rate": 0.00011435491916534919,
"loss": 0.2604,
"mean_token_accuracy": 0.9346008896827698,
"num_tokens": 856275.0,
"step": 113
},
{
"epoch": 1.4430379746835442,
"grad_norm": 0.44608280062675476,
"learning_rate": 0.00011299594467831078,
"loss": 0.228,
"mean_token_accuracy": 0.9441589117050171,
"num_tokens": 863538.0,
"step": 114
},
{
"epoch": 1.4556962025316456,
"grad_norm": 0.4609827995300293,
"learning_rate": 0.00011163452434124773,
"loss": 0.2174,
"mean_token_accuracy": 0.9422593116760254,
"num_tokens": 871153.0,
"step": 115
},
{
"epoch": 1.4683544303797469,
"grad_norm": 0.49709534645080566,
"learning_rate": 0.00011027091437485404,
"loss": 0.2661,
"mean_token_accuracy": 0.9356223344802856,
"num_tokens": 878673.0,
"step": 116
},
{
"epoch": 1.481012658227848,
"grad_norm": 0.5192921161651611,
"learning_rate": 0.00010890537141191417,
"loss": 0.2455,
"mean_token_accuracy": 0.9369285702705383,
"num_tokens": 886284.0,
"step": 117
},
{
"epoch": 1.4936708860759493,
"grad_norm": 0.4980919361114502,
"learning_rate": 0.00010753815244900458,
"loss": 0.2275,
"mean_token_accuracy": 0.9405483603477478,
"num_tokens": 893934.0,
"step": 118
},
{
"epoch": 1.5063291139240507,
"grad_norm": 0.5131703019142151,
"learning_rate": 0.00010616951479812658,
"loss": 0.2225,
"mean_token_accuracy": 0.9432948231697083,
"num_tokens": 901440.0,
"step": 119
},
{
"epoch": 1.518987341772152,
"grad_norm": 0.4802223742008209,
"learning_rate": 0.00010479971603828,
"loss": 0.2342,
"mean_token_accuracy": 0.9367021322250366,
"num_tokens": 909024.0,
"step": 120
},
{
"epoch": 1.5316455696202531,
"grad_norm": 0.45383986830711365,
"learning_rate": 0.00010342901396698659,
"loss": 0.1994,
"mean_token_accuracy": 0.949091911315918,
"num_tokens": 916356.0,
"step": 121
},
{
"epoch": 1.5443037974683544,
"grad_norm": 0.44705086946487427,
"learning_rate": 0.00010205766655177215,
"loss": 0.2427,
"mean_token_accuracy": 0.9395003914833069,
"num_tokens": 924106.0,
"step": 122
},
{
"epoch": 1.5569620253164556,
"grad_norm": 0.4181109368801117,
"learning_rate": 0.00010068593188161697,
"loss": 0.1947,
"mean_token_accuracy": 0.9488508105278015,
"num_tokens": 931697.0,
"step": 123
},
{
"epoch": 1.5696202531645569,
"grad_norm": 0.48091140389442444,
"learning_rate": 9.931406811838308e-05,
"loss": 0.2203,
"mean_token_accuracy": 0.9425989985466003,
"num_tokens": 939287.0,
"step": 124
},
{
"epoch": 1.5822784810126582,
"grad_norm": 0.5527205467224121,
"learning_rate": 9.79423334482279e-05,
"loss": 0.2429,
"mean_token_accuracy": 0.9346159100532532,
"num_tokens": 947044.0,
"step": 125
},
{
"epoch": 1.5949367088607596,
"grad_norm": 0.4698488414287567,
"learning_rate": 9.657098603301346e-05,
"loss": 0.2084,
"mean_token_accuracy": 0.9460563659667969,
"num_tokens": 954449.0,
"step": 126
},
{
"epoch": 1.6075949367088609,
"grad_norm": 0.4221295416355133,
"learning_rate": 9.520028396172003e-05,
"loss": 0.1854,
"mean_token_accuracy": 0.9494868516921997,
"num_tokens": 962016.0,
"step": 127
},
{
"epoch": 1.620253164556962,
"grad_norm": 0.4718606472015381,
"learning_rate": 9.383048520187344e-05,
"loss": 0.2105,
"mean_token_accuracy": 0.9448257088661194,
"num_tokens": 969511.0,
"step": 128
},
{
"epoch": 1.6329113924050633,
"grad_norm": 0.4742836058139801,
"learning_rate": 9.246184755099545e-05,
"loss": 0.1948,
"mean_token_accuracy": 0.9457446932792664,
"num_tokens": 977095.0,
"step": 129
},
{
"epoch": 1.6455696202531644,
"grad_norm": 0.5384134650230408,
"learning_rate": 9.109462858808586e-05,
"loss": 0.2481,
"mean_token_accuracy": 0.9373098611831665,
"num_tokens": 984720.0,
"step": 130
},
{
"epoch": 1.6582278481012658,
"grad_norm": 0.4646705090999603,
"learning_rate": 8.972908562514598e-05,
"loss": 0.2173,
"mean_token_accuracy": 0.9455537796020508,
"num_tokens": 992296.0,
"step": 131
},
{
"epoch": 1.6708860759493671,
"grad_norm": 0.449430376291275,
"learning_rate": 8.836547565875227e-05,
"loss": 0.2098,
"mean_token_accuracy": 0.9462523460388184,
"num_tokens": 999858.0,
"step": 132
},
{
"epoch": 1.6835443037974684,
"grad_norm": 0.4542527496814728,
"learning_rate": 8.70040553216892e-05,
"loss": 0.2089,
"mean_token_accuracy": 0.9469392895698547,
"num_tokens": 1007649.0,
"step": 133
},
{
"epoch": 1.6962025316455698,
"grad_norm": 0.3584607243537903,
"learning_rate": 8.564508083465079e-05,
"loss": 0.1621,
"mean_token_accuracy": 0.9558292031288147,
"num_tokens": 1015184.0,
"step": 134
},
{
"epoch": 1.7088607594936709,
"grad_norm": 0.43875524401664734,
"learning_rate": 8.428880795801965e-05,
"loss": 0.1803,
"mean_token_accuracy": 0.952750563621521,
"num_tokens": 1022592.0,
"step": 135
},
{
"epoch": 1.721518987341772,
"grad_norm": 0.4122496545314789,
"learning_rate": 8.293549194373243e-05,
"loss": 0.1948,
"mean_token_accuracy": 0.9484121799468994,
"num_tokens": 1030119.0,
"step": 136
},
{
"epoch": 1.7341772151898733,
"grad_norm": 0.3599133789539337,
"learning_rate": 8.158538748724139e-05,
"loss": 0.1398,
"mean_token_accuracy": 0.9603773355484009,
"num_tokens": 1037603.0,
"step": 137
},
{
"epoch": 1.7468354430379747,
"grad_norm": 0.424468070268631,
"learning_rate": 8.023874867958027e-05,
"loss": 0.1822,
"mean_token_accuracy": 0.9513099193572998,
"num_tokens": 1045492.0,
"step": 138
},
{
"epoch": 1.759493670886076,
"grad_norm": 0.5632903575897217,
"learning_rate": 7.889582895954427e-05,
"loss": 0.2294,
"mean_token_accuracy": 0.941025972366333,
"num_tokens": 1052983.0,
"step": 139
},
{
"epoch": 1.7721518987341773,
"grad_norm": 0.42068415880203247,
"learning_rate": 7.755688106599241e-05,
"loss": 0.1866,
"mean_token_accuracy": 0.9484808444976807,
"num_tokens": 1060617.0,
"step": 140
},
{
"epoch": 1.7848101265822784,
"grad_norm": 0.36526110768318176,
"learning_rate": 7.622215699028196e-05,
"loss": 0.163,
"mean_token_accuracy": 0.9539258480072021,
"num_tokens": 1068017.0,
"step": 141
},
{
"epoch": 1.7974683544303798,
"grad_norm": 0.45511889457702637,
"learning_rate": 7.489190792884338e-05,
"loss": 0.1854,
"mean_token_accuracy": 0.9514201283454895,
"num_tokens": 1075862.0,
"step": 142
},
{
"epoch": 1.810126582278481,
"grad_norm": 0.3653993010520935,
"learning_rate": 7.356638423590485e-05,
"loss": 0.1502,
"mean_token_accuracy": 0.9577220678329468,
"num_tokens": 1083424.0,
"step": 143
},
{
"epoch": 1.8227848101265822,
"grad_norm": 0.494686484336853,
"learning_rate": 7.224583537637544e-05,
"loss": 0.2014,
"mean_token_accuracy": 0.9472861886024475,
"num_tokens": 1091171.0,
"step": 144
},
{
"epoch": 1.8354430379746836,
"grad_norm": 0.4973593056201935,
"learning_rate": 7.093050987889547e-05,
"loss": 0.1619,
"mean_token_accuracy": 0.9606246948242188,
"num_tokens": 1098727.0,
"step": 145
},
{
"epoch": 1.8481012658227849,
"grad_norm": 0.439903199672699,
"learning_rate": 6.96206552890632e-05,
"loss": 0.1495,
"mean_token_accuracy": 0.9583563208580017,
"num_tokens": 1106043.0,
"step": 146
},
{
"epoch": 1.8607594936708862,
"grad_norm": 0.41443145275115967,
"learning_rate": 6.831651812284652e-05,
"loss": 0.1627,
"mean_token_accuracy": 0.9576634764671326,
"num_tokens": 1113571.0,
"step": 147
},
{
"epoch": 1.8734177215189873,
"grad_norm": 0.41921186447143555,
"learning_rate": 6.701834382018832e-05,
"loss": 0.1768,
"mean_token_accuracy": 0.9537719488143921,
"num_tokens": 1121098.0,
"step": 148
},
{
"epoch": 1.8860759493670884,
"grad_norm": 0.4211632013320923,
"learning_rate": 6.572637669881458e-05,
"loss": 0.1552,
"mean_token_accuracy": 0.9575773477554321,
"num_tokens": 1128823.0,
"step": 149
},
{
"epoch": 1.8987341772151898,
"grad_norm": 0.365162193775177,
"learning_rate": 6.444085990825338e-05,
"loss": 0.1308,
"mean_token_accuracy": 0.9660908579826355,
"num_tokens": 1136702.0,
"step": 150
},
{
"epoch": 1.9113924050632911,
"grad_norm": 0.6042749285697937,
"learning_rate": 6.316203538407397e-05,
"loss": 0.1883,
"mean_token_accuracy": 0.9514773488044739,
"num_tokens": 1144618.0,
"step": 151
},
{
"epoch": 1.9240506329113924,
"grad_norm": 0.504920482635498,
"learning_rate": 6.18901438023543e-05,
"loss": 0.1711,
"mean_token_accuracy": 0.9596337080001831,
"num_tokens": 1152436.0,
"step": 152
},
{
"epoch": 1.9367088607594938,
"grad_norm": 0.3634421229362488,
"learning_rate": 6.0625424534385425e-05,
"loss": 0.1232,
"mean_token_accuracy": 0.9661855101585388,
"num_tokens": 1159982.0,
"step": 153
},
{
"epoch": 1.9493670886075949,
"grad_norm": 0.43088358640670776,
"learning_rate": 5.936811560162169e-05,
"loss": 0.152,
"mean_token_accuracy": 0.9582157731056213,
"num_tokens": 1167489.0,
"step": 154
},
{
"epoch": 1.9620253164556962,
"grad_norm": 0.5033516883850098,
"learning_rate": 5.811845363088477e-05,
"loss": 0.1624,
"mean_token_accuracy": 0.956744372844696,
"num_tokens": 1174974.0,
"step": 155
},
{
"epoch": 1.9746835443037973,
"grad_norm": 0.37854012846946716,
"learning_rate": 5.687667380983037e-05,
"loss": 0.1418,
"mean_token_accuracy": 0.9615023732185364,
"num_tokens": 1182493.0,
"step": 156
},
{
"epoch": 1.9873417721518987,
"grad_norm": 0.5239201188087463,
"learning_rate": 5.5643009842685554e-05,
"loss": 0.1954,
"mean_token_accuracy": 0.9525497555732727,
"num_tokens": 1189891.0,
"step": 157
},
{
"epoch": 2.0,
"grad_norm": 0.2560364007949829,
"learning_rate": 5.4417693906265365e-05,
"loss": 0.11,
"mean_token_accuracy": 0.9704713821411133,
"num_tokens": 1197507.0,
"step": 158
},
{
"epoch": 2.0126582278481013,
"grad_norm": 0.24716579914093018,
"learning_rate": 5.3200956606277006e-05,
"loss": 0.1053,
"mean_token_accuracy": 0.9706624150276184,
"num_tokens": 1205104.0,
"step": 159
},
{
"epoch": 2.0253164556962027,
"grad_norm": 0.2239724099636078,
"learning_rate": 5.199302693391959e-05,
"loss": 0.1069,
"mean_token_accuracy": 0.9724477529525757,
"num_tokens": 1212681.0,
"step": 160
},
{
"epoch": 2.037974683544304,
"grad_norm": 0.32893016934394836,
"learning_rate": 5.0794132222787707e-05,
"loss": 0.1162,
"mean_token_accuracy": 0.970269501209259,
"num_tokens": 1219943.0,
"step": 161
},
{
"epoch": 2.050632911392405,
"grad_norm": 0.30835914611816406,
"learning_rate": 4.960449810608705e-05,
"loss": 0.1296,
"mean_token_accuracy": 0.9655404686927795,
"num_tokens": 1227436.0,
"step": 162
},
{
"epoch": 2.0632911392405062,
"grad_norm": 0.20363426208496094,
"learning_rate": 4.8424348474170014e-05,
"loss": 0.0901,
"mean_token_accuracy": 0.9714903235435486,
"num_tokens": 1234901.0,
"step": 163
},
{
"epoch": 2.0759493670886076,
"grad_norm": 0.2451593428850174,
"learning_rate": 4.725390543239929e-05,
"loss": 0.0913,
"mean_token_accuracy": 0.9731382727622986,
"num_tokens": 1242485.0,
"step": 164
},
{
"epoch": 2.088607594936709,
"grad_norm": 0.28893059492111206,
"learning_rate": 4.609338925934743e-05,
"loss": 0.1102,
"mean_token_accuracy": 0.9688106775283813,
"num_tokens": 1250276.0,
"step": 165
},
{
"epoch": 2.1012658227848102,
"grad_norm": 0.38036951422691345,
"learning_rate": 4.494301836534016e-05,
"loss": 0.1068,
"mean_token_accuracy": 0.9714133739471436,
"num_tokens": 1257861.0,
"step": 166
},
{
"epoch": 2.1139240506329116,
"grad_norm": 0.3020472824573517,
"learning_rate": 4.380300925135138e-05,
"loss": 0.1045,
"mean_token_accuracy": 0.9713066816329956,
"num_tokens": 1265662.0,
"step": 167
},
{
"epoch": 2.1265822784810124,
"grad_norm": 0.33828258514404297,
"learning_rate": 4.267357646825746e-05,
"loss": 0.1028,
"mean_token_accuracy": 0.9701977968215942,
"num_tokens": 1273410.0,
"step": 168
},
{
"epoch": 2.1392405063291138,
"grad_norm": 0.3408215045928955,
"learning_rate": 4.1554932576458415e-05,
"loss": 0.1015,
"mean_token_accuracy": 0.9716554880142212,
"num_tokens": 1280777.0,
"step": 169
},
{
"epoch": 2.151898734177215,
"grad_norm": 0.3681698143482208,
"learning_rate": 4.044728810587406e-05,
"loss": 0.1087,
"mean_token_accuracy": 0.969260036945343,
"num_tokens": 1288193.0,
"step": 170
},
{
"epoch": 2.1645569620253164,
"grad_norm": 0.29635900259017944,
"learning_rate": 3.935085151632185e-05,
"loss": 0.0924,
"mean_token_accuracy": 0.9743622541427612,
"num_tokens": 1296058.0,
"step": 171
},
{
"epoch": 2.1772151898734178,
"grad_norm": 0.3427096903324127,
"learning_rate": 3.826582915828468e-05,
"loss": 0.1048,
"mean_token_accuracy": 0.9713760614395142,
"num_tokens": 1303738.0,
"step": 172
},
{
"epoch": 2.189873417721519,
"grad_norm": 0.2907073497772217,
"learning_rate": 3.719242523407539e-05,
"loss": 0.093,
"mean_token_accuracy": 0.9729946255683899,
"num_tokens": 1311282.0,
"step": 173
},
{
"epoch": 2.2025316455696204,
"grad_norm": 0.27637961506843567,
"learning_rate": 3.613084175940578e-05,
"loss": 0.0992,
"mean_token_accuracy": 0.9711666107177734,
"num_tokens": 1318872.0,
"step": 174
},
{
"epoch": 2.2151898734177213,
"grad_norm": 0.3511016070842743,
"learning_rate": 3.508127852536698e-05,
"loss": 0.1015,
"mean_token_accuracy": 0.9672537446022034,
"num_tokens": 1326204.0,
"step": 175
},
{
"epoch": 2.2278481012658227,
"grad_norm": 0.27166008949279785,
"learning_rate": 3.4043933060828605e-05,
"loss": 0.0981,
"mean_token_accuracy": 0.9703683853149414,
"num_tokens": 1333760.0,
"step": 176
},
{
"epoch": 2.240506329113924,
"grad_norm": 0.2674514651298523,
"learning_rate": 3.3019000595263574e-05,
"loss": 0.1004,
"mean_token_accuracy": 0.9706788063049316,
"num_tokens": 1341293.0,
"step": 177
},
{
"epoch": 2.2531645569620253,
"grad_norm": 0.2489694356918335,
"learning_rate": 3.200667402200586e-05,
"loss": 0.1005,
"mean_token_accuracy": 0.9710597991943359,
"num_tokens": 1348717.0,
"step": 178
},
{
"epoch": 2.2658227848101267,
"grad_norm": 0.2744084894657135,
"learning_rate": 3.100714386194757e-05,
"loss": 0.1089,
"mean_token_accuracy": 0.9690406322479248,
"num_tokens": 1356307.0,
"step": 179
},
{
"epoch": 2.278481012658228,
"grad_norm": 0.3626236319541931,
"learning_rate": 3.0020598227682795e-05,
"loss": 0.107,
"mean_token_accuracy": 0.9673758745193481,
"num_tokens": 1364126.0,
"step": 180
},
{
"epoch": 2.291139240506329,
"grad_norm": 0.2569406032562256,
"learning_rate": 2.904722278810471e-05,
"loss": 0.1014,
"mean_token_accuracy": 0.9709012508392334,
"num_tokens": 1371613.0,
"step": 181
},
{
"epoch": 2.3037974683544302,
"grad_norm": 0.3285917639732361,
"learning_rate": 2.8087200733462425e-05,
"loss": 0.1046,
"mean_token_accuracy": 0.9690940380096436,
"num_tokens": 1379216.0,
"step": 182
},
{
"epoch": 2.3164556962025316,
"grad_norm": 0.20964039862155914,
"learning_rate": 2.7140712740884376e-05,
"loss": 0.0985,
"mean_token_accuracy": 0.9698275923728943,
"num_tokens": 1386704.0,
"step": 183
},
{
"epoch": 2.329113924050633,
"grad_norm": 0.3338058292865753,
"learning_rate": 2.6207936940374767e-05,
"loss": 0.0947,
"mean_token_accuracy": 0.971538245677948,
"num_tokens": 1394322.0,
"step": 184
},
{
"epoch": 2.3417721518987342,
"grad_norm": 0.24734541773796082,
"learning_rate": 2.5289048881289256e-05,
"loss": 0.0899,
"mean_token_accuracy": 0.9753498435020447,
"num_tokens": 1402175.0,
"step": 185
},
{
"epoch": 2.3544303797468356,
"grad_norm": 0.2708415985107422,
"learning_rate": 2.4384221499296466e-05,
"loss": 0.1001,
"mean_token_accuracy": 0.9718623161315918,
"num_tokens": 1409880.0,
"step": 186
},
{
"epoch": 2.367088607594937,
"grad_norm": 0.3055052161216736,
"learning_rate": 2.3493625083831217e-05,
"loss": 0.1024,
"mean_token_accuracy": 0.9690194129943848,
"num_tokens": 1417368.0,
"step": 187
},
{
"epoch": 2.379746835443038,
"grad_norm": 0.2778116464614868,
"learning_rate": 2.2617427246045973e-05,
"loss": 0.0987,
"mean_token_accuracy": 0.9698062539100647,
"num_tokens": 1424917.0,
"step": 188
},
{
"epoch": 2.392405063291139,
"grad_norm": 0.21404311060905457,
"learning_rate": 2.1755792887266234e-05,
"loss": 0.0975,
"mean_token_accuracy": 0.9730854034423828,
"num_tokens": 1432672.0,
"step": 189
},
{
"epoch": 2.4050632911392404,
"grad_norm": 0.22275599837303162,
"learning_rate": 2.0908884167955824e-05,
"loss": 0.0955,
"mean_token_accuracy": 0.9734768867492676,
"num_tokens": 1440352.0,
"step": 190
},
{
"epoch": 2.4177215189873418,
"grad_norm": 0.3580118417739868,
"learning_rate": 2.0076860477198313e-05,
"loss": 0.0976,
"mean_token_accuracy": 0.9713793396949768,
"num_tokens": 1447963.0,
"step": 191
},
{
"epoch": 2.430379746835443,
"grad_norm": 0.2647789716720581,
"learning_rate": 1.9259878402699705e-05,
"loss": 0.0998,
"mean_token_accuracy": 0.9713677167892456,
"num_tokens": 1455536.0,
"step": 192
},
{
"epoch": 2.4430379746835444,
"grad_norm": 0.23201273381710052,
"learning_rate": 1.8458091701318504e-05,
"loss": 0.0961,
"mean_token_accuracy": 0.9719387888908386,
"num_tokens": 1463048.0,
"step": 193
},
{
"epoch": 2.4556962025316453,
"grad_norm": 0.2607119083404541,
"learning_rate": 1.7671651270128532e-05,
"loss": 0.0949,
"mean_token_accuracy": 0.9710144996643066,
"num_tokens": 1470564.0,
"step": 194
},
{
"epoch": 2.4683544303797467,
"grad_norm": 0.2727314531803131,
"learning_rate": 1.69007051180199e-05,
"loss": 0.0973,
"mean_token_accuracy": 0.9722861051559448,
"num_tokens": 1478458.0,
"step": 195
},
{
"epoch": 2.481012658227848,
"grad_norm": 0.25747543573379517,
"learning_rate": 1.6145398337843652e-05,
"loss": 0.0913,
"mean_token_accuracy": 0.9718737602233887,
"num_tokens": 1486095.0,
"step": 196
},
{
"epoch": 2.4936708860759493,
"grad_norm": 0.28386300802230835,
"learning_rate": 1.540587307910508e-05,
"loss": 0.1082,
"mean_token_accuracy": 0.9686080813407898,
"num_tokens": 1493645.0,
"step": 197
},
{
"epoch": 2.5063291139240507,
"grad_norm": 0.2482428401708603,
"learning_rate": 1.4682268521211073e-05,
"loss": 0.0945,
"mean_token_accuracy": 0.9698053002357483,
"num_tokens": 1501260.0,
"step": 198
},
{
"epoch": 2.518987341772152,
"grad_norm": 0.29959413409233093,
"learning_rate": 1.3974720847276412e-05,
"loss": 0.1103,
"mean_token_accuracy": 0.9704062342643738,
"num_tokens": 1508758.0,
"step": 199
},
{
"epoch": 2.5316455696202533,
"grad_norm": 0.2617916762828827,
"learning_rate": 1.328336321849396e-05,
"loss": 0.0965,
"mean_token_accuracy": 0.972577691078186,
"num_tokens": 1516480.0,
"step": 200
},
{
"epoch": 2.5443037974683547,
"grad_norm": 0.25122788548469543,
"learning_rate": 1.2608325749073591e-05,
"loss": 0.0989,
"mean_token_accuracy": 0.971817672252655,
"num_tokens": 1523960.0,
"step": 201
},
{
"epoch": 2.5569620253164556,
"grad_norm": 0.23365901410579681,
"learning_rate": 1.1949735481754565e-05,
"loss": 0.0911,
"mean_token_accuracy": 0.9739062786102295,
"num_tokens": 1531727.0,
"step": 202
},
{
"epoch": 2.569620253164557,
"grad_norm": 0.3107486963272095,
"learning_rate": 1.130771636389596e-05,
"loss": 0.1038,
"mean_token_accuracy": 0.9700414538383484,
"num_tokens": 1539268.0,
"step": 203
},
{
"epoch": 2.5822784810126582,
"grad_norm": 0.2310217171907425,
"learning_rate": 1.0682389224149647e-05,
"loss": 0.0948,
"mean_token_accuracy": 0.9715954065322876,
"num_tokens": 1546866.0,
"step": 204
},
{
"epoch": 2.5949367088607596,
"grad_norm": 0.20603010058403015,
"learning_rate": 1.0073871749720221e-05,
"loss": 0.0947,
"mean_token_accuracy": 0.9721407890319824,
"num_tokens": 1554432.0,
"step": 205
},
{
"epoch": 2.607594936708861,
"grad_norm": 0.22616903483867645,
"learning_rate": 9.482278464216121e-06,
"loss": 0.0934,
"mean_token_accuracy": 0.9742143154144287,
"num_tokens": 1561942.0,
"step": 206
},
{
"epoch": 2.620253164556962,
"grad_norm": 0.29869943857192993,
"learning_rate": 8.907720706096224e-06,
"loss": 0.099,
"mean_token_accuracy": 0.9707894921302795,
"num_tokens": 1569606.0,
"step": 207
},
{
"epoch": 2.632911392405063,
"grad_norm": 0.18506982922554016,
"learning_rate": 8.350306607715774e-06,
"loss": 0.0967,
"mean_token_accuracy": 0.9730911254882812,
"num_tokens": 1576991.0,
"step": 208
},
{
"epoch": 2.6455696202531644,
"grad_norm": 0.3081600069999695,
"learning_rate": 7.810141074975818e-06,
"loss": 0.1021,
"mean_token_accuracy": 0.9701170921325684,
"num_tokens": 1584484.0,
"step": 209
},
{
"epoch": 2.6582278481012658,
"grad_norm": 0.27944669127464294,
"learning_rate": 7.287325767579756e-06,
"loss": 0.1081,
"mean_token_accuracy": 0.9698938727378845,
"num_tokens": 1592088.0,
"step": 210
},
{
"epoch": 2.670886075949367,
"grad_norm": 0.1560535430908203,
"learning_rate": 6.781959079900957e-06,
"loss": 0.0884,
"mean_token_accuracy": 0.9742401242256165,
"num_tokens": 1599489.0,
"step": 211
},
{
"epoch": 2.6835443037974684,
"grad_norm": 0.2630186378955841,
"learning_rate": 6.2941361224647e-06,
"loss": 0.1012,
"mean_token_accuracy": 0.9717521667480469,
"num_tokens": 1607235.0,
"step": 212
},
{
"epoch": 2.6962025316455698,
"grad_norm": 0.20801326632499695,
"learning_rate": 5.823948704048443e-06,
"loss": 0.094,
"mean_token_accuracy": 0.9722370505332947,
"num_tokens": 1614791.0,
"step": 213
},
{
"epoch": 2.708860759493671,
"grad_norm": 0.23363713920116425,
"learning_rate": 5.371485314403202e-06,
"loss": 0.1017,
"mean_token_accuracy": 0.9724119901657104,
"num_tokens": 1622467.0,
"step": 214
},
{
"epoch": 2.721518987341772,
"grad_norm": 0.27849259972572327,
"learning_rate": 4.936831107599749e-06,
"loss": 0.106,
"mean_token_accuracy": 0.9699349999427795,
"num_tokens": 1629915.0,
"step": 215
},
{
"epoch": 2.7341772151898733,
"grad_norm": 0.2073725014925003,
"learning_rate": 4.5200678860024885e-06,
"loss": 0.0941,
"mean_token_accuracy": 0.9706724882125854,
"num_tokens": 1637310.0,
"step": 216
},
{
"epoch": 2.7468354430379747,
"grad_norm": 0.2289542257785797,
"learning_rate": 4.121274084874194e-06,
"loss": 0.0926,
"mean_token_accuracy": 0.973173975944519,
"num_tokens": 1644904.0,
"step": 217
},
{
"epoch": 2.759493670886076,
"grad_norm": 0.2967240512371063,
"learning_rate": 3.7405247576144054e-06,
"loss": 0.0947,
"mean_token_accuracy": 0.9712704420089722,
"num_tokens": 1652556.0,
"step": 218
},
{
"epoch": 2.7721518987341773,
"grad_norm": 0.2061406522989273,
"learning_rate": 3.3778915616342943e-06,
"loss": 0.0921,
"mean_token_accuracy": 0.9731997847557068,
"num_tokens": 1660008.0,
"step": 219
},
{
"epoch": 2.7848101265822782,
"grad_norm": 0.20453591644763947,
"learning_rate": 3.0334427448706847e-06,
"loss": 0.0912,
"mean_token_accuracy": 0.9720537662506104,
"num_tokens": 1667658.0,
"step": 220
},
{
"epoch": 2.7974683544303796,
"grad_norm": 0.23907408118247986,
"learning_rate": 2.707243132941717e-06,
"loss": 0.0965,
"mean_token_accuracy": 0.9735056757926941,
"num_tokens": 1675535.0,
"step": 221
},
{
"epoch": 2.810126582278481,
"grad_norm": 0.3273867070674896,
"learning_rate": 2.3993541169465837e-06,
"loss": 0.0951,
"mean_token_accuracy": 0.9698397517204285,
"num_tokens": 1683026.0,
"step": 222
},
{
"epoch": 2.8227848101265822,
"grad_norm": 0.2258942574262619,
"learning_rate": 2.1098336419116625e-06,
"loss": 0.0954,
"mean_token_accuracy": 0.9716787338256836,
"num_tokens": 1690399.0,
"step": 223
},
{
"epoch": 2.8354430379746836,
"grad_norm": 0.21475453674793243,
"learning_rate": 1.838736195885238e-06,
"loss": 0.0915,
"mean_token_accuracy": 0.9741595387458801,
"num_tokens": 1698048.0,
"step": 224
},
{
"epoch": 2.848101265822785,
"grad_norm": 0.2630147635936737,
"learning_rate": 1.5861127996827597e-06,
"loss": 0.0987,
"mean_token_accuracy": 0.9713319540023804,
"num_tokens": 1705507.0,
"step": 225
},
{
"epoch": 2.8607594936708862,
"grad_norm": 0.24740326404571533,
"learning_rate": 1.3520109972846917e-06,
"loss": 0.0953,
"mean_token_accuracy": 0.9725081324577332,
"num_tokens": 1712955.0,
"step": 226
},
{
"epoch": 2.8734177215189876,
"grad_norm": 0.21480882167816162,
"learning_rate": 1.1364748468886687e-06,
"loss": 0.0936,
"mean_token_accuracy": 0.9725086092948914,
"num_tokens": 1720294.0,
"step": 227
},
{
"epoch": 2.8860759493670884,
"grad_norm": 0.17724719643592834,
"learning_rate": 9.395449126177291e-07,
"loss": 0.0865,
"mean_token_accuracy": 0.9737974405288696,
"num_tokens": 1728029.0,
"step": 228
},
{
"epoch": 2.8987341772151898,
"grad_norm": 0.1948229819536209,
"learning_rate": 7.612582568860549e-07,
"loss": 0.0908,
"mean_token_accuracy": 0.9719676375389099,
"num_tokens": 1735513.0,
"step": 229
},
{
"epoch": 2.911392405063291,
"grad_norm": 0.2432938814163208,
"learning_rate": 6.016484334238515e-07,
"loss": 0.0976,
"mean_token_accuracy": 0.9726666808128357,
"num_tokens": 1743077.0,
"step": 230
},
{
"epoch": 2.9240506329113924,
"grad_norm": 0.334950715303421,
"learning_rate": 4.607454809624434e-07,
"loss": 0.1115,
"mean_token_accuracy": 0.9661816954612732,
"num_tokens": 1750770.0,
"step": 231
},
{
"epoch": 2.9367088607594938,
"grad_norm": 0.2737453281879425,
"learning_rate": 3.385759175809966e-07,
"loss": 0.0976,
"mean_token_accuracy": 0.9702790379524231,
"num_tokens": 1758539.0,
"step": 232
},
{
"epoch": 2.9493670886075947,
"grad_norm": 0.20212914049625397,
"learning_rate": 2.3516273571577708e-07,
"loss": 0.0922,
"mean_token_accuracy": 0.972845196723938,
"num_tokens": 1766005.0,
"step": 233
},
{
"epoch": 2.962025316455696,
"grad_norm": 0.28339385986328125,
"learning_rate": 1.505253978329235e-07,
"loss": 0.1017,
"mean_token_accuracy": 0.9697776436805725,
"num_tokens": 1773580.0,
"step": 234
},
{
"epoch": 2.9746835443037973,
"grad_norm": 0.18123164772987366,
"learning_rate": 8.467983276563284e-08,
"loss": 0.0896,
"mean_token_accuracy": 0.9740137457847595,
"num_tokens": 1781071.0,
"step": 235
},
{
"epoch": 2.9873417721518987,
"grad_norm": 0.21046403050422668,
"learning_rate": 3.763843271631373e-08,
"loss": 0.0926,
"mean_token_accuracy": 0.9746376872062683,
"num_tokens": 1788587.0,
"step": 236
},
{
"epoch": 3.0,
"grad_norm": 0.22790654003620148,
"learning_rate": 9.410050924374415e-09,
"loss": 0.085,
"mean_token_accuracy": 0.9737589359283447,
"num_tokens": 1796044.0,
"step": 237
},
{
"epoch": 3.0,
"step": 237,
"total_flos": 1.1297352468712653e+17,
"train_loss": 0.33737788211067016,
"train_runtime": 357.577,
"train_samples_per_second": 41.949,
"train_steps_per_second": 0.663
}
],
"logging_steps": 1.0,
"max_steps": 237,
"num_input_tokens_seen": 0,
"num_train_epochs": 3,
"save_steps": 100,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": true
},
"attributes": {}
}
},
"total_flos": 1.1297352468712653e+17,
"train_batch_size": 16,
"trial_name": null,
"trial_params": null
}