YeMoKoo's picture
Add final checkpoint: trace_upstream_pre_order4
7d1ab68 verified
Raw
History Blame Contribute Delete
101 kB
{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 5.0,
"eval_steps": 500,
"global_step": 395,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.012658227848101266,
"grad_norm": 1.497319221496582,
"learning_rate": 0.0,
"loss": 0.9641,
"mean_token_accuracy": 0.8309550285339355,
"num_tokens": 30618.0,
"step": 1
},
{
"epoch": 0.02531645569620253,
"grad_norm": 1.6209511756896973,
"learning_rate": 1.6666666666666667e-05,
"loss": 1.0149,
"mean_token_accuracy": 0.8291102051734924,
"num_tokens": 57834.0,
"step": 2
},
{
"epoch": 0.0379746835443038,
"grad_norm": 1.4961398839950562,
"learning_rate": 3.3333333333333335e-05,
"loss": 1.0358,
"mean_token_accuracy": 0.8215629458427429,
"num_tokens": 83683.0,
"step": 3
},
{
"epoch": 0.05063291139240506,
"grad_norm": 1.0754140615463257,
"learning_rate": 5e-05,
"loss": 0.9624,
"mean_token_accuracy": 0.8206241130828857,
"num_tokens": 109319.0,
"step": 4
},
{
"epoch": 0.06329113924050633,
"grad_norm": 1.3018057346343994,
"learning_rate": 6.666666666666667e-05,
"loss": 0.8462,
"mean_token_accuracy": 0.831474781036377,
"num_tokens": 130905.0,
"step": 5
},
{
"epoch": 0.0759493670886076,
"grad_norm": 0.5650571584701538,
"learning_rate": 8.333333333333334e-05,
"loss": 0.7473,
"mean_token_accuracy": 0.83799809217453,
"num_tokens": 161660.0,
"step": 6
},
{
"epoch": 0.08860759493670886,
"grad_norm": 0.6237565279006958,
"learning_rate": 0.0001,
"loss": 0.6972,
"mean_token_accuracy": 0.8451058864593506,
"num_tokens": 191893.0,
"step": 7
},
{
"epoch": 0.10126582278481013,
"grad_norm": 0.5601367950439453,
"learning_rate": 0.00011666666666666668,
"loss": 0.6946,
"mean_token_accuracy": 0.852936863899231,
"num_tokens": 219163.0,
"step": 8
},
{
"epoch": 0.11392405063291139,
"grad_norm": 0.42522192001342773,
"learning_rate": 0.00013333333333333334,
"loss": 0.6029,
"mean_token_accuracy": 0.8602243661880493,
"num_tokens": 249175.0,
"step": 9
},
{
"epoch": 0.12658227848101267,
"grad_norm": 0.8065161108970642,
"learning_rate": 0.00015000000000000001,
"loss": 0.6507,
"mean_token_accuracy": 0.8582913875579834,
"num_tokens": 269887.0,
"step": 10
},
{
"epoch": 0.13924050632911392,
"grad_norm": 0.3548448979854584,
"learning_rate": 0.0001666666666666667,
"loss": 0.5643,
"mean_token_accuracy": 0.869491696357727,
"num_tokens": 297750.0,
"step": 11
},
{
"epoch": 0.1518987341772152,
"grad_norm": 0.43577635288238525,
"learning_rate": 0.00018333333333333334,
"loss": 0.623,
"mean_token_accuracy": 0.8579869866371155,
"num_tokens": 323030.0,
"step": 12
},
{
"epoch": 0.16455696202531644,
"grad_norm": 0.34569233655929565,
"learning_rate": 0.0002,
"loss": 0.5558,
"mean_token_accuracy": 0.8676020503044128,
"num_tokens": 353170.0,
"step": 13
},
{
"epoch": 0.17721518987341772,
"grad_norm": 0.2973344624042511,
"learning_rate": 0.0001999966358932628,
"loss": 0.5502,
"mean_token_accuracy": 0.8723801970481873,
"num_tokens": 381576.0,
"step": 14
},
{
"epoch": 0.189873417721519,
"grad_norm": 0.6846588850021362,
"learning_rate": 0.00019998654379939533,
"loss": 0.5728,
"mean_token_accuracy": 0.8665502667427063,
"num_tokens": 409703.0,
"step": 15
},
{
"epoch": 0.20253164556962025,
"grad_norm": 0.29646769165992737,
"learning_rate": 0.00019996972439741538,
"loss": 0.5858,
"mean_token_accuracy": 0.865411102771759,
"num_tokens": 438811.0,
"step": 16
},
{
"epoch": 0.21518987341772153,
"grad_norm": 0.288542777299881,
"learning_rate": 0.0001999461788189681,
"loss": 0.5725,
"mean_token_accuracy": 0.866082489490509,
"num_tokens": 468774.0,
"step": 17
},
{
"epoch": 0.22784810126582278,
"grad_norm": 0.2656330466270447,
"learning_rate": 0.00019991590864825028,
"loss": 0.5151,
"mean_token_accuracy": 0.8826677799224854,
"num_tokens": 492753.0,
"step": 18
},
{
"epoch": 0.24050632911392406,
"grad_norm": 0.27023324370384216,
"learning_rate": 0.00019987891592190366,
"loss": 0.5078,
"mean_token_accuracy": 0.8805520534515381,
"num_tokens": 523031.0,
"step": 19
},
{
"epoch": 0.25316455696202533,
"grad_norm": 0.25212258100509644,
"learning_rate": 0.00019983520312887785,
"loss": 0.5289,
"mean_token_accuracy": 0.8810333013534546,
"num_tokens": 552515.0,
"step": 20
},
{
"epoch": 0.26582278481012656,
"grad_norm": 0.24047309160232544,
"learning_rate": 0.00019978477321026282,
"loss": 0.5344,
"mean_token_accuracy": 0.8764937520027161,
"num_tokens": 583290.0,
"step": 21
},
{
"epoch": 0.27848101265822783,
"grad_norm": 0.27291324734687805,
"learning_rate": 0.0001997276295590912,
"loss": 0.4812,
"mean_token_accuracy": 0.8868094682693481,
"num_tokens": 603285.0,
"step": 22
},
{
"epoch": 0.2911392405063291,
"grad_norm": 0.23373258113861084,
"learning_rate": 0.00019966377602010984,
"loss": 0.5465,
"mean_token_accuracy": 0.8753286004066467,
"num_tokens": 637583.0,
"step": 23
},
{
"epoch": 0.3037974683544304,
"grad_norm": 0.23137561976909637,
"learning_rate": 0.0001995932168895211,
"loss": 0.5222,
"mean_token_accuracy": 0.8756207823753357,
"num_tokens": 668657.0,
"step": 24
},
{
"epoch": 0.31645569620253167,
"grad_norm": 0.24308426678180695,
"learning_rate": 0.00019951595691469396,
"loss": 0.5396,
"mean_token_accuracy": 0.8727737069129944,
"num_tokens": 695335.0,
"step": 25
},
{
"epoch": 0.3291139240506329,
"grad_norm": 0.22916540503501892,
"learning_rate": 0.00019943200129384444,
"loss": 0.5382,
"mean_token_accuracy": 0.8756353855133057,
"num_tokens": 723727.0,
"step": 26
},
{
"epoch": 0.34177215189873417,
"grad_norm": 0.24699705839157104,
"learning_rate": 0.0001993413556756859,
"loss": 0.476,
"mean_token_accuracy": 0.8846983313560486,
"num_tokens": 751154.0,
"step": 27
},
{
"epoch": 0.35443037974683544,
"grad_norm": 0.21457427740097046,
"learning_rate": 0.0001992440261590491,
"loss": 0.5159,
"mean_token_accuracy": 0.8788135647773743,
"num_tokens": 783078.0,
"step": 28
},
{
"epoch": 0.3670886075949367,
"grad_norm": 0.2982902526855469,
"learning_rate": 0.00019914001929247167,
"loss": 0.5296,
"mean_token_accuracy": 0.8727933168411255,
"num_tokens": 802685.0,
"step": 29
},
{
"epoch": 0.379746835443038,
"grad_norm": 0.2390463650226593,
"learning_rate": 0.0001990293420737576,
"loss": 0.5509,
"mean_token_accuracy": 0.8691502213478088,
"num_tokens": 826425.0,
"step": 30
},
{
"epoch": 0.3924050632911392,
"grad_norm": 0.2494283765554428,
"learning_rate": 0.00019891200194950643,
"loss": 0.5748,
"mean_token_accuracy": 0.8628107905387878,
"num_tokens": 851265.0,
"step": 31
},
{
"epoch": 0.4050632911392405,
"grad_norm": 0.23986820876598358,
"learning_rate": 0.00019878800681461222,
"loss": 0.5099,
"mean_token_accuracy": 0.8775585889816284,
"num_tokens": 878297.0,
"step": 32
},
{
"epoch": 0.4177215189873418,
"grad_norm": 0.24641895294189453,
"learning_rate": 0.00019865736501173238,
"loss": 0.473,
"mean_token_accuracy": 0.8891056180000305,
"num_tokens": 899381.0,
"step": 33
},
{
"epoch": 0.43037974683544306,
"grad_norm": 0.20981378853321075,
"learning_rate": 0.00019852008533072625,
"loss": 0.5352,
"mean_token_accuracy": 0.8746247887611389,
"num_tokens": 930759.0,
"step": 34
},
{
"epoch": 0.4430379746835443,
"grad_norm": 0.23973393440246582,
"learning_rate": 0.00019837617700806383,
"loss": 0.5283,
"mean_token_accuracy": 0.874847948551178,
"num_tokens": 957135.0,
"step": 35
},
{
"epoch": 0.45569620253164556,
"grad_norm": 0.2420441061258316,
"learning_rate": 0.00019822564972620427,
"loss": 0.5032,
"mean_token_accuracy": 0.8739088773727417,
"num_tokens": 981142.0,
"step": 36
},
{
"epoch": 0.46835443037974683,
"grad_norm": 0.2016650289297104,
"learning_rate": 0.0001980685136129445,
"loss": 0.5553,
"mean_token_accuracy": 0.8701525330543518,
"num_tokens": 1009855.0,
"step": 37
},
{
"epoch": 0.4810126582278481,
"grad_norm": 0.213796928524971,
"learning_rate": 0.00019790477924073755,
"loss": 0.562,
"mean_token_accuracy": 0.8700422048568726,
"num_tokens": 1035989.0,
"step": 38
},
{
"epoch": 0.4936708860759494,
"grad_norm": 0.22555865347385406,
"learning_rate": 0.00019773445762598163,
"loss": 0.487,
"mean_token_accuracy": 0.8849612474441528,
"num_tokens": 1063409.0,
"step": 39
},
{
"epoch": 0.5063291139240507,
"grad_norm": 0.2065822184085846,
"learning_rate": 0.00019755756022827846,
"loss": 0.542,
"mean_token_accuracy": 0.8749595880508423,
"num_tokens": 1094423.0,
"step": 40
},
{
"epoch": 0.5189873417721519,
"grad_norm": 0.22671450674533844,
"learning_rate": 0.00019737409894966267,
"loss": 0.5801,
"mean_token_accuracy": 0.868348240852356,
"num_tokens": 1119067.0,
"step": 41
},
{
"epoch": 0.5316455696202531,
"grad_norm": 0.20396192371845245,
"learning_rate": 0.00019718408613380074,
"loss": 0.508,
"mean_token_accuracy": 0.8748582601547241,
"num_tokens": 1147347.0,
"step": 42
},
{
"epoch": 0.5443037974683544,
"grad_norm": 0.20259220898151398,
"learning_rate": 0.00019698753456516048,
"loss": 0.4897,
"mean_token_accuracy": 0.8824638724327087,
"num_tokens": 1174458.0,
"step": 43
},
{
"epoch": 0.5569620253164557,
"grad_norm": 0.2087836116552353,
"learning_rate": 0.00019678445746815107,
"loss": 0.4807,
"mean_token_accuracy": 0.8824238777160645,
"num_tokens": 1202708.0,
"step": 44
},
{
"epoch": 0.569620253164557,
"grad_norm": 0.1992674618959427,
"learning_rate": 0.00019657486850623306,
"loss": 0.4824,
"mean_token_accuracy": 0.8790597915649414,
"num_tokens": 1226511.0,
"step": 45
},
{
"epoch": 0.5822784810126582,
"grad_norm": 0.1843205988407135,
"learning_rate": 0.00019635878178099928,
"loss": 0.4737,
"mean_token_accuracy": 0.8844873905181885,
"num_tokens": 1254823.0,
"step": 46
},
{
"epoch": 0.5949367088607594,
"grad_norm": 0.21726590394973755,
"learning_rate": 0.0001961362118312259,
"loss": 0.5116,
"mean_token_accuracy": 0.8761377334594727,
"num_tokens": 1280157.0,
"step": 47
},
{
"epoch": 0.6075949367088608,
"grad_norm": 0.18547309935092926,
"learning_rate": 0.0001959071736318942,
"loss": 0.5088,
"mean_token_accuracy": 0.877997636795044,
"num_tokens": 1311204.0,
"step": 48
},
{
"epoch": 0.620253164556962,
"grad_norm": 0.17424975335597992,
"learning_rate": 0.00019567168259318325,
"loss": 0.4827,
"mean_token_accuracy": 0.8858836889266968,
"num_tokens": 1338924.0,
"step": 49
},
{
"epoch": 0.6329113924050633,
"grad_norm": 0.2047286480665207,
"learning_rate": 0.00019542975455943281,
"loss": 0.5123,
"mean_token_accuracy": 0.8828940987586975,
"num_tokens": 1364640.0,
"step": 50
},
{
"epoch": 0.6455696202531646,
"grad_norm": 0.2273840606212616,
"learning_rate": 0.00019518140580807744,
"loss": 0.5769,
"mean_token_accuracy": 0.8684936165809631,
"num_tokens": 1386817.0,
"step": 51
},
{
"epoch": 0.6582278481012658,
"grad_norm": 0.19929328560829163,
"learning_rate": 0.00019492665304855132,
"loss": 0.5269,
"mean_token_accuracy": 0.8812709450721741,
"num_tokens": 1417598.0,
"step": 52
},
{
"epoch": 0.6708860759493671,
"grad_norm": 0.18103498220443726,
"learning_rate": 0.0001946655134211639,
"loss": 0.5201,
"mean_token_accuracy": 0.8795331120491028,
"num_tokens": 1452103.0,
"step": 53
},
{
"epoch": 0.6835443037974683,
"grad_norm": 0.20823192596435547,
"learning_rate": 0.0001943980044959468,
"loss": 0.4376,
"mean_token_accuracy": 0.8970240354537964,
"num_tokens": 1476260.0,
"step": 54
},
{
"epoch": 0.6962025316455697,
"grad_norm": 0.2124900221824646,
"learning_rate": 0.0001941241442714716,
"loss": 0.4992,
"mean_token_accuracy": 0.8834120035171509,
"num_tokens": 1505761.0,
"step": 55
},
{
"epoch": 0.7088607594936709,
"grad_norm": 0.19194459915161133,
"learning_rate": 0.0001938439511736388,
"loss": 0.5092,
"mean_token_accuracy": 0.8822512626647949,
"num_tokens": 1535906.0,
"step": 56
},
{
"epoch": 0.7215189873417721,
"grad_norm": 0.1868598908185959,
"learning_rate": 0.0001935574440544381,
"loss": 0.5125,
"mean_token_accuracy": 0.8755715489387512,
"num_tokens": 1569652.0,
"step": 57
},
{
"epoch": 0.7341772151898734,
"grad_norm": 0.21098805963993073,
"learning_rate": 0.0001932646421906802,
"loss": 0.5394,
"mean_token_accuracy": 0.8751370906829834,
"num_tokens": 1596153.0,
"step": 58
},
{
"epoch": 0.7468354430379747,
"grad_norm": 0.2013338804244995,
"learning_rate": 0.00019296556528269952,
"loss": 0.5081,
"mean_token_accuracy": 0.8786186575889587,
"num_tokens": 1624508.0,
"step": 59
},
{
"epoch": 0.759493670886076,
"grad_norm": 0.20497922599315643,
"learning_rate": 0.00019266023345302887,
"loss": 0.4502,
"mean_token_accuracy": 0.8902367353439331,
"num_tokens": 1653507.0,
"step": 60
},
{
"epoch": 0.7721518987341772,
"grad_norm": 0.21349601447582245,
"learning_rate": 0.00019234866724504555,
"loss": 0.5481,
"mean_token_accuracy": 0.8724722266197205,
"num_tokens": 1682796.0,
"step": 61
},
{
"epoch": 0.7848101265822784,
"grad_norm": 0.2057465761899948,
"learning_rate": 0.00019203088762158915,
"loss": 0.5103,
"mean_token_accuracy": 0.8791164755821228,
"num_tokens": 1710159.0,
"step": 62
},
{
"epoch": 0.7974683544303798,
"grad_norm": 0.20737606287002563,
"learning_rate": 0.00019170691596355114,
"loss": 0.5126,
"mean_token_accuracy": 0.8805774450302124,
"num_tokens": 1739246.0,
"step": 63
},
{
"epoch": 0.810126582278481,
"grad_norm": 0.1765468269586563,
"learning_rate": 0.00019137677406843619,
"loss": 0.4658,
"mean_token_accuracy": 0.8891183733940125,
"num_tokens": 1770785.0,
"step": 64
},
{
"epoch": 0.8227848101265823,
"grad_norm": 0.18958942592144012,
"learning_rate": 0.00019104048414889587,
"loss": 0.4893,
"mean_token_accuracy": 0.8855167031288147,
"num_tokens": 1800635.0,
"step": 65
},
{
"epoch": 0.8354430379746836,
"grad_norm": 0.19879435002803802,
"learning_rate": 0.00019069806883123387,
"loss": 0.4883,
"mean_token_accuracy": 0.8844217658042908,
"num_tokens": 1829104.0,
"step": 66
},
{
"epoch": 0.8481012658227848,
"grad_norm": 0.19173026084899902,
"learning_rate": 0.00019034955115388363,
"loss": 0.549,
"mean_token_accuracy": 0.8704302906990051,
"num_tokens": 1858519.0,
"step": 67
},
{
"epoch": 0.8607594936708861,
"grad_norm": 0.19198986887931824,
"learning_rate": 0.00018999495456585854,
"loss": 0.4972,
"mean_token_accuracy": 0.8800837993621826,
"num_tokens": 1882458.0,
"step": 68
},
{
"epoch": 0.8734177215189873,
"grad_norm": 0.17567826807498932,
"learning_rate": 0.00018963430292517398,
"loss": 0.4852,
"mean_token_accuracy": 0.8849237561225891,
"num_tokens": 1914075.0,
"step": 69
},
{
"epoch": 0.8860759493670886,
"grad_norm": 0.20886963605880737,
"learning_rate": 0.00018926762049724228,
"loss": 0.5113,
"mean_token_accuracy": 0.8759188652038574,
"num_tokens": 1941347.0,
"step": 70
},
{
"epoch": 0.8987341772151899,
"grad_norm": 0.2045935094356537,
"learning_rate": 0.00018889493195323997,
"loss": 0.5075,
"mean_token_accuracy": 0.8776924014091492,
"num_tokens": 1969128.0,
"step": 71
},
{
"epoch": 0.9113924050632911,
"grad_norm": 0.19722214341163635,
"learning_rate": 0.00018851626236844786,
"loss": 0.5154,
"mean_token_accuracy": 0.8768007159233093,
"num_tokens": 1995848.0,
"step": 72
},
{
"epoch": 0.9240506329113924,
"grad_norm": 0.21611221134662628,
"learning_rate": 0.00018813163722056396,
"loss": 0.4651,
"mean_token_accuracy": 0.8872132897377014,
"num_tokens": 2021243.0,
"step": 73
},
{
"epoch": 0.9367088607594937,
"grad_norm": 0.2026682049036026,
"learning_rate": 0.0001877410823879893,
"loss": 0.4772,
"mean_token_accuracy": 0.8879674077033997,
"num_tokens": 2048558.0,
"step": 74
},
{
"epoch": 0.9493670886075949,
"grad_norm": 0.21699966490268707,
"learning_rate": 0.0001873446241480868,
"loss": 0.5288,
"mean_token_accuracy": 0.8744093179702759,
"num_tokens": 2078250.0,
"step": 75
},
{
"epoch": 0.9620253164556962,
"grad_norm": 0.20321376621723175,
"learning_rate": 0.00018694228917541313,
"loss": 0.5249,
"mean_token_accuracy": 0.8785193562507629,
"num_tokens": 2107652.0,
"step": 76
},
{
"epoch": 0.9746835443037974,
"grad_norm": 0.23255208134651184,
"learning_rate": 0.00018653410453992413,
"loss": 0.5065,
"mean_token_accuracy": 0.8786671757698059,
"num_tokens": 2134576.0,
"step": 77
},
{
"epoch": 0.9873417721518988,
"grad_norm": 0.19896215200424194,
"learning_rate": 0.0001861200977051535,
"loss": 0.4681,
"mean_token_accuracy": 0.8856458067893982,
"num_tokens": 2162186.0,
"step": 78
},
{
"epoch": 1.0,
"grad_norm": 0.19284109771251678,
"learning_rate": 0.0001857002965263648,
"loss": 0.4793,
"mean_token_accuracy": 0.8867379426956177,
"num_tokens": 2191333.0,
"step": 79
},
{
"epoch": 1.0126582278481013,
"grad_norm": 0.19497530162334442,
"learning_rate": 0.00018527472924867756,
"loss": 0.4209,
"mean_token_accuracy": 0.8986303210258484,
"num_tokens": 2218703.0,
"step": 80
},
{
"epoch": 1.0253164556962024,
"grad_norm": 0.21513301134109497,
"learning_rate": 0.00018484342450516671,
"loss": 0.5105,
"mean_token_accuracy": 0.8765804767608643,
"num_tokens": 2239963.0,
"step": 81
},
{
"epoch": 1.0379746835443038,
"grad_norm": 0.1873137354850769,
"learning_rate": 0.0001844064113149361,
"loss": 0.4353,
"mean_token_accuracy": 0.8936419486999512,
"num_tokens": 2267331.0,
"step": 82
},
{
"epoch": 1.0506329113924051,
"grad_norm": 0.22090038657188416,
"learning_rate": 0.0001839637190811661,
"loss": 0.4297,
"mean_token_accuracy": 0.8943843245506287,
"num_tokens": 2296955.0,
"step": 83
},
{
"epoch": 1.0632911392405062,
"grad_norm": 0.2521970570087433,
"learning_rate": 0.00018351537758913518,
"loss": 0.4325,
"mean_token_accuracy": 0.8930135369300842,
"num_tokens": 2321452.0,
"step": 84
},
{
"epoch": 1.0759493670886076,
"grad_norm": 0.21923896670341492,
"learning_rate": 0.00018306141700421606,
"loss": 0.4213,
"mean_token_accuracy": 0.8969642519950867,
"num_tokens": 2350603.0,
"step": 85
},
{
"epoch": 1.0886075949367089,
"grad_norm": 0.22946420311927795,
"learning_rate": 0.000182601867869846,
"loss": 0.4009,
"mean_token_accuracy": 0.8988001942634583,
"num_tokens": 2374254.0,
"step": 86
},
{
"epoch": 1.1012658227848102,
"grad_norm": 0.20290835201740265,
"learning_rate": 0.00018213676110547176,
"loss": 0.4228,
"mean_token_accuracy": 0.8960235118865967,
"num_tokens": 2406633.0,
"step": 87
},
{
"epoch": 1.1139240506329113,
"grad_norm": 0.1907222718000412,
"learning_rate": 0.0001816661280044693,
"loss": 0.4115,
"mean_token_accuracy": 0.9003381729125977,
"num_tokens": 2437451.0,
"step": 88
},
{
"epoch": 1.1265822784810127,
"grad_norm": 0.20857387781143188,
"learning_rate": 0.00018119000023203837,
"loss": 0.4526,
"mean_token_accuracy": 0.8939969539642334,
"num_tokens": 2470165.0,
"step": 89
},
{
"epoch": 1.139240506329114,
"grad_norm": 0.2178468257188797,
"learning_rate": 0.0001807084098230719,
"loss": 0.4361,
"mean_token_accuracy": 0.892597496509552,
"num_tokens": 2496774.0,
"step": 90
},
{
"epoch": 1.1518987341772151,
"grad_norm": 0.1978338062763214,
"learning_rate": 0.0001802213891800007,
"loss": 0.4079,
"mean_token_accuracy": 0.89795982837677,
"num_tokens": 2527620.0,
"step": 91
},
{
"epoch": 1.1645569620253164,
"grad_norm": 0.23382915556430817,
"learning_rate": 0.00017972897107061328,
"loss": 0.4385,
"mean_token_accuracy": 0.8920117616653442,
"num_tokens": 2551131.0,
"step": 92
},
{
"epoch": 1.1772151898734178,
"grad_norm": 0.24582549929618835,
"learning_rate": 0.00017923118862585123,
"loss": 0.4494,
"mean_token_accuracy": 0.892306387424469,
"num_tokens": 2574604.0,
"step": 93
},
{
"epoch": 1.189873417721519,
"grad_norm": 0.21195554733276367,
"learning_rate": 0.00017872807533758007,
"loss": 0.4428,
"mean_token_accuracy": 0.8914760947227478,
"num_tokens": 2605675.0,
"step": 94
},
{
"epoch": 1.2025316455696202,
"grad_norm": 0.2021542638540268,
"learning_rate": 0.00017821966505633587,
"loss": 0.4294,
"mean_token_accuracy": 0.8925318121910095,
"num_tokens": 2633403.0,
"step": 95
},
{
"epoch": 1.2151898734177216,
"grad_norm": 0.19734586775302887,
"learning_rate": 0.00017770599198904763,
"loss": 0.4105,
"mean_token_accuracy": 0.8953525424003601,
"num_tokens": 2664753.0,
"step": 96
},
{
"epoch": 1.2278481012658227,
"grad_norm": 0.19101551175117493,
"learning_rate": 0.00017718709069673594,
"loss": 0.4008,
"mean_token_accuracy": 0.9017804861068726,
"num_tokens": 2695707.0,
"step": 97
},
{
"epoch": 1.240506329113924,
"grad_norm": 0.22164419293403625,
"learning_rate": 0.00017666299609218745,
"loss": 0.4233,
"mean_token_accuracy": 0.8975086212158203,
"num_tokens": 2721861.0,
"step": 98
},
{
"epoch": 1.2531645569620253,
"grad_norm": 0.21174238622188568,
"learning_rate": 0.00017613374343760594,
"loss": 0.4644,
"mean_token_accuracy": 0.8886749744415283,
"num_tokens": 2749457.0,
"step": 99
},
{
"epoch": 1.2658227848101267,
"grad_norm": 0.22876623272895813,
"learning_rate": 0.00017559936834223982,
"loss": 0.4407,
"mean_token_accuracy": 0.8907697200775146,
"num_tokens": 2773269.0,
"step": 100
},
{
"epoch": 1.2784810126582278,
"grad_norm": 0.19537781178951263,
"learning_rate": 0.0001750599067599863,
"loss": 0.3998,
"mean_token_accuracy": 0.9017773866653442,
"num_tokens": 2800170.0,
"step": 101
},
{
"epoch": 1.2911392405063291,
"grad_norm": 0.21778103709220886,
"learning_rate": 0.00017451539498697225,
"loss": 0.3569,
"mean_token_accuracy": 0.9102327227592468,
"num_tokens": 2824597.0,
"step": 102
},
{
"epoch": 1.3037974683544304,
"grad_norm": 0.21380816400051117,
"learning_rate": 0.0001739658696591121,
"loss": 0.4263,
"mean_token_accuracy": 0.8967190980911255,
"num_tokens": 2855354.0,
"step": 103
},
{
"epoch": 1.3164556962025316,
"grad_norm": 0.21955636143684387,
"learning_rate": 0.00017341136774964307,
"loss": 0.4062,
"mean_token_accuracy": 0.8979187607765198,
"num_tokens": 2881652.0,
"step": 104
},
{
"epoch": 1.3291139240506329,
"grad_norm": 0.2105690985918045,
"learning_rate": 0.0001728519265666373,
"loss": 0.4,
"mean_token_accuracy": 0.8993932008743286,
"num_tokens": 2909567.0,
"step": 105
},
{
"epoch": 1.3417721518987342,
"grad_norm": 0.20753523707389832,
"learning_rate": 0.00017228758375049185,
"loss": 0.4455,
"mean_token_accuracy": 0.8925303220748901,
"num_tokens": 2933889.0,
"step": 106
},
{
"epoch": 1.3544303797468356,
"grad_norm": 0.2187478095293045,
"learning_rate": 0.00017171837727139613,
"loss": 0.4434,
"mean_token_accuracy": 0.8895025849342346,
"num_tokens": 2962017.0,
"step": 107
},
{
"epoch": 1.3670886075949367,
"grad_norm": 0.22173349559307098,
"learning_rate": 0.0001711443454267772,
"loss": 0.4333,
"mean_token_accuracy": 0.8912394046783447,
"num_tokens": 2991862.0,
"step": 108
},
{
"epoch": 1.379746835443038,
"grad_norm": 0.22389379143714905,
"learning_rate": 0.00017056552683872292,
"loss": 0.4185,
"mean_token_accuracy": 0.8991497755050659,
"num_tokens": 3017449.0,
"step": 109
},
{
"epoch": 1.3924050632911391,
"grad_norm": 0.270313024520874,
"learning_rate": 0.00016998196045138353,
"loss": 0.4902,
"mean_token_accuracy": 0.8868701457977295,
"num_tokens": 3041070.0,
"step": 110
},
{
"epoch": 1.4050632911392404,
"grad_norm": 0.20855283737182617,
"learning_rate": 0.00016939368552835137,
"loss": 0.3887,
"mean_token_accuracy": 0.9015379548072815,
"num_tokens": 3070069.0,
"step": 111
},
{
"epoch": 1.4177215189873418,
"grad_norm": 0.20110635459423065,
"learning_rate": 0.00016880074165001905,
"loss": 0.4372,
"mean_token_accuracy": 0.8943763971328735,
"num_tokens": 3099047.0,
"step": 112
},
{
"epoch": 1.4303797468354431,
"grad_norm": 0.21372906863689423,
"learning_rate": 0.0001682031687109165,
"loss": 0.42,
"mean_token_accuracy": 0.8982757925987244,
"num_tokens": 3125732.0,
"step": 113
},
{
"epoch": 1.4430379746835442,
"grad_norm": 0.20921871066093445,
"learning_rate": 0.00016760100691702674,
"loss": 0.4196,
"mean_token_accuracy": 0.8972339034080505,
"num_tokens": 3154862.0,
"step": 114
},
{
"epoch": 1.4556962025316456,
"grad_norm": 0.1881207674741745,
"learning_rate": 0.0001669942967830807,
"loss": 0.4093,
"mean_token_accuracy": 0.9019440412521362,
"num_tokens": 3184195.0,
"step": 115
},
{
"epoch": 1.4683544303797469,
"grad_norm": 0.213323712348938,
"learning_rate": 0.00016638307912983136,
"loss": 0.4138,
"mean_token_accuracy": 0.9011819362640381,
"num_tokens": 3211248.0,
"step": 116
},
{
"epoch": 1.481012658227848,
"grad_norm": 0.20287197828292847,
"learning_rate": 0.00016576739508130726,
"loss": 0.3756,
"mean_token_accuracy": 0.9048148393630981,
"num_tokens": 3239205.0,
"step": 117
},
{
"epoch": 1.4936708860759493,
"grad_norm": 0.20273637771606445,
"learning_rate": 0.0001651472860620455,
"loss": 0.3689,
"mean_token_accuracy": 0.9055525660514832,
"num_tokens": 3266914.0,
"step": 118
},
{
"epoch": 1.5063291139240507,
"grad_norm": 0.19134242832660675,
"learning_rate": 0.00016452279379430463,
"loss": 0.4183,
"mean_token_accuracy": 0.897467851638794,
"num_tokens": 3296676.0,
"step": 119
},
{
"epoch": 1.518987341772152,
"grad_norm": 0.18769560754299164,
"learning_rate": 0.00016389396029525762,
"loss": 0.4204,
"mean_token_accuracy": 0.8977954983711243,
"num_tokens": 3325046.0,
"step": 120
},
{
"epoch": 1.5316455696202531,
"grad_norm": 0.20102067291736603,
"learning_rate": 0.0001632608278741646,
"loss": 0.4496,
"mean_token_accuracy": 0.8929321765899658,
"num_tokens": 3354624.0,
"step": 121
},
{
"epoch": 1.5443037974683544,
"grad_norm": 0.1878257691860199,
"learning_rate": 0.00016262343912952656,
"loss": 0.3981,
"mean_token_accuracy": 0.8984882831573486,
"num_tokens": 3383000.0,
"step": 122
},
{
"epoch": 1.5569620253164556,
"grad_norm": 0.20456744730472565,
"learning_rate": 0.0001619818369462188,
"loss": 0.4161,
"mean_token_accuracy": 0.8959950804710388,
"num_tokens": 3410630.0,
"step": 123
},
{
"epoch": 1.5696202531645569,
"grad_norm": 0.2185913473367691,
"learning_rate": 0.0001613360644926059,
"loss": 0.4096,
"mean_token_accuracy": 0.9008986949920654,
"num_tokens": 3435063.0,
"step": 124
},
{
"epoch": 1.5822784810126582,
"grad_norm": 0.2265142947435379,
"learning_rate": 0.00016068616521763707,
"loss": 0.4471,
"mean_token_accuracy": 0.8928737640380859,
"num_tokens": 3460947.0,
"step": 125
},
{
"epoch": 1.5949367088607596,
"grad_norm": 0.19072851538658142,
"learning_rate": 0.00016003218284792298,
"loss": 0.3973,
"mean_token_accuracy": 0.90379399061203,
"num_tokens": 3490136.0,
"step": 126
},
{
"epoch": 1.6075949367088609,
"grad_norm": 0.23255592584609985,
"learning_rate": 0.00015937416138479344,
"loss": 0.399,
"mean_token_accuracy": 0.8998273015022278,
"num_tokens": 3516255.0,
"step": 127
},
{
"epoch": 1.620253164556962,
"grad_norm": 0.2036372721195221,
"learning_rate": 0.0001587121451013373,
"loss": 0.3952,
"mean_token_accuracy": 0.8992496728897095,
"num_tokens": 3548438.0,
"step": 128
},
{
"epoch": 1.6329113924050633,
"grad_norm": 0.23039649426937103,
"learning_rate": 0.0001580461785394233,
"loss": 0.4062,
"mean_token_accuracy": 0.8986396789550781,
"num_tokens": 3579451.0,
"step": 129
},
{
"epoch": 1.6455696202531644,
"grad_norm": 0.20787346363067627,
"learning_rate": 0.00015737630650670335,
"loss": 0.4023,
"mean_token_accuracy": 0.899288535118103,
"num_tokens": 3610296.0,
"step": 130
},
{
"epoch": 1.6582278481012658,
"grad_norm": 0.23658980429172516,
"learning_rate": 0.00015670257407359792,
"loss": 0.446,
"mean_token_accuracy": 0.8890199661254883,
"num_tokens": 3638329.0,
"step": 131
},
{
"epoch": 1.6708860759493671,
"grad_norm": 0.191447913646698,
"learning_rate": 0.00015602502657026328,
"loss": 0.4013,
"mean_token_accuracy": 0.9007358551025391,
"num_tokens": 3671960.0,
"step": 132
},
{
"epoch": 1.6835443037974684,
"grad_norm": 0.22027570009231567,
"learning_rate": 0.00015534370958354186,
"loss": 0.4291,
"mean_token_accuracy": 0.8947672247886658,
"num_tokens": 3698033.0,
"step": 133
},
{
"epoch": 1.6962025316455698,
"grad_norm": 0.2189820110797882,
"learning_rate": 0.00015465866895389495,
"loss": 0.4787,
"mean_token_accuracy": 0.8886910080909729,
"num_tokens": 3725049.0,
"step": 134
},
{
"epoch": 1.7088607594936709,
"grad_norm": 0.22296729683876038,
"learning_rate": 0.00015396995077231854,
"loss": 0.4155,
"mean_token_accuracy": 0.897777259349823,
"num_tokens": 3751477.0,
"step": 135
},
{
"epoch": 1.721518987341772,
"grad_norm": 0.1950179785490036,
"learning_rate": 0.00015327760137724212,
"loss": 0.425,
"mean_token_accuracy": 0.8947750926017761,
"num_tokens": 3783178.0,
"step": 136
},
{
"epoch": 1.7341772151898733,
"grad_norm": 0.2167259156703949,
"learning_rate": 0.00015258166735141092,
"loss": 0.4632,
"mean_token_accuracy": 0.8899510502815247,
"num_tokens": 3812847.0,
"step": 137
},
{
"epoch": 1.7468354430379747,
"grad_norm": 0.23227916657924652,
"learning_rate": 0.0001518821955187519,
"loss": 0.4228,
"mean_token_accuracy": 0.8922276496887207,
"num_tokens": 3837704.0,
"step": 138
},
{
"epoch": 1.759493670886076,
"grad_norm": 0.20364798605442047,
"learning_rate": 0.00015117923294122312,
"loss": 0.4357,
"mean_token_accuracy": 0.8921459913253784,
"num_tokens": 3870312.0,
"step": 139
},
{
"epoch": 1.7721518987341773,
"grad_norm": 0.22296567261219025,
"learning_rate": 0.0001504728269156475,
"loss": 0.4091,
"mean_token_accuracy": 0.9001960754394531,
"num_tokens": 3896387.0,
"step": 140
},
{
"epoch": 1.7848101265822784,
"grad_norm": 0.23284538090229034,
"learning_rate": 0.00014976302497053036,
"loss": 0.4685,
"mean_token_accuracy": 0.8888003826141357,
"num_tokens": 3922809.0,
"step": 141
},
{
"epoch": 1.7974683544303798,
"grad_norm": 0.20585279166698456,
"learning_rate": 0.00014904987486286184,
"loss": 0.4155,
"mean_token_accuracy": 0.8993297219276428,
"num_tokens": 3954799.0,
"step": 142
},
{
"epoch": 1.810126582278481,
"grad_norm": 0.2125055342912674,
"learning_rate": 0.00014833342457490361,
"loss": 0.424,
"mean_token_accuracy": 0.8967812061309814,
"num_tokens": 3985216.0,
"step": 143
},
{
"epoch": 1.8227848101265822,
"grad_norm": 0.22574758529663086,
"learning_rate": 0.00014761372231096047,
"loss": 0.4477,
"mean_token_accuracy": 0.8949366807937622,
"num_tokens": 4008190.0,
"step": 144
},
{
"epoch": 1.8354430379746836,
"grad_norm": 0.21060273051261902,
"learning_rate": 0.00014689081649413708,
"loss": 0.4216,
"mean_token_accuracy": 0.8979432582855225,
"num_tokens": 4033877.0,
"step": 145
},
{
"epoch": 1.8481012658227849,
"grad_norm": 0.22009049355983734,
"learning_rate": 0.00014616475576308005,
"loss": 0.4303,
"mean_token_accuracy": 0.894666314125061,
"num_tokens": 4058558.0,
"step": 146
},
{
"epoch": 1.8607594936708862,
"grad_norm": 0.2193581908941269,
"learning_rate": 0.00014543558896870531,
"loss": 0.4647,
"mean_token_accuracy": 0.8923094868659973,
"num_tokens": 4084446.0,
"step": 147
},
{
"epoch": 1.8734177215189873,
"grad_norm": 0.218804270029068,
"learning_rate": 0.0001447033651709114,
"loss": 0.425,
"mean_token_accuracy": 0.8992093801498413,
"num_tokens": 4108669.0,
"step": 148
},
{
"epoch": 1.8860759493670884,
"grad_norm": 0.1919749528169632,
"learning_rate": 0.0001439681336352785,
"loss": 0.4495,
"mean_token_accuracy": 0.891620934009552,
"num_tokens": 4146434.0,
"step": 149
},
{
"epoch": 1.8987341772151898,
"grad_norm": 0.19265611469745636,
"learning_rate": 0.00014322994382975386,
"loss": 0.3672,
"mean_token_accuracy": 0.9077484607696533,
"num_tokens": 4176633.0,
"step": 150
},
{
"epoch": 1.9113924050632911,
"grad_norm": 0.2111128568649292,
"learning_rate": 0.0001424888454213235,
"loss": 0.4511,
"mean_token_accuracy": 0.889907956123352,
"num_tokens": 4205046.0,
"step": 151
},
{
"epoch": 1.9240506329113924,
"grad_norm": 0.22748497128486633,
"learning_rate": 0.0001417448882726703,
"loss": 0.3854,
"mean_token_accuracy": 0.90329909324646,
"num_tokens": 4230208.0,
"step": 152
},
{
"epoch": 1.9367088607594938,
"grad_norm": 0.23460358381271362,
"learning_rate": 0.00014099812243881948,
"loss": 0.4264,
"mean_token_accuracy": 0.8937097787857056,
"num_tokens": 4254357.0,
"step": 153
},
{
"epoch": 1.9493670886075949,
"grad_norm": 0.2445940524339676,
"learning_rate": 0.00014024859816377046,
"loss": 0.4507,
"mean_token_accuracy": 0.8903029561042786,
"num_tokens": 4278779.0,
"step": 154
},
{
"epoch": 1.9620253164556962,
"grad_norm": 0.2431238889694214,
"learning_rate": 0.00013949636587711644,
"loss": 0.4341,
"mean_token_accuracy": 0.89263516664505,
"num_tokens": 4303460.0,
"step": 155
},
{
"epoch": 1.9746835443037973,
"grad_norm": 0.22417189180850983,
"learning_rate": 0.0001387414761906516,
"loss": 0.4369,
"mean_token_accuracy": 0.893901526927948,
"num_tokens": 4330744.0,
"step": 156
},
{
"epoch": 1.9873417721518987,
"grad_norm": 0.24654226005077362,
"learning_rate": 0.00013798397989496549,
"loss": 0.4348,
"mean_token_accuracy": 0.8898520469665527,
"num_tokens": 4354803.0,
"step": 157
},
{
"epoch": 2.0,
"grad_norm": 0.21234261989593506,
"learning_rate": 0.00013722392795602594,
"loss": 0.3543,
"mean_token_accuracy": 0.9114936590194702,
"num_tokens": 4380368.0,
"step": 158
},
{
"epoch": 2.0126582278481013,
"grad_norm": 0.27655863761901855,
"learning_rate": 0.0001364613715117499,
"loss": 0.3225,
"mean_token_accuracy": 0.918269693851471,
"num_tokens": 4400290.0,
"step": 159
},
{
"epoch": 2.0253164556962027,
"grad_norm": 0.2500605583190918,
"learning_rate": 0.00013569636186856288,
"loss": 0.3184,
"mean_token_accuracy": 0.9159533381462097,
"num_tokens": 4424186.0,
"step": 160
},
{
"epoch": 2.037974683544304,
"grad_norm": 0.23898674547672272,
"learning_rate": 0.0001349289504979467,
"loss": 0.312,
"mean_token_accuracy": 0.9217621088027954,
"num_tokens": 4447359.0,
"step": 161
},
{
"epoch": 2.050632911392405,
"grad_norm": 0.26260843873023987,
"learning_rate": 0.0001341591890329766,
"loss": 0.3502,
"mean_token_accuracy": 0.9151948690414429,
"num_tokens": 4475393.0,
"step": 162
},
{
"epoch": 2.0632911392405062,
"grad_norm": 0.3176262080669403,
"learning_rate": 0.00013338712926484725,
"loss": 0.2907,
"mean_token_accuracy": 0.9248190522193909,
"num_tokens": 4504467.0,
"step": 163
},
{
"epoch": 2.0759493670886076,
"grad_norm": 0.3452271819114685,
"learning_rate": 0.00013261282313938795,
"loss": 0.3302,
"mean_token_accuracy": 0.9150597453117371,
"num_tokens": 4536683.0,
"step": 164
},
{
"epoch": 2.088607594936709,
"grad_norm": 0.30614957213401794,
"learning_rate": 0.00013183632275356777,
"loss": 0.3393,
"mean_token_accuracy": 0.9161185026168823,
"num_tokens": 4563654.0,
"step": 165
},
{
"epoch": 2.1012658227848102,
"grad_norm": 0.24343803524971008,
"learning_rate": 0.00013105768035199034,
"loss": 0.2901,
"mean_token_accuracy": 0.924813449382782,
"num_tokens": 4590651.0,
"step": 166
},
{
"epoch": 2.1139240506329116,
"grad_norm": 0.2270330786705017,
"learning_rate": 0.0001302769483233786,
"loss": 0.3091,
"mean_token_accuracy": 0.9209712147712708,
"num_tokens": 4620122.0,
"step": 167
},
{
"epoch": 2.1265822784810124,
"grad_norm": 0.2397693246603012,
"learning_rate": 0.00012949417919705007,
"loss": 0.3475,
"mean_token_accuracy": 0.9106589555740356,
"num_tokens": 4646333.0,
"step": 168
},
{
"epoch": 2.1392405063291138,
"grad_norm": 0.24059844017028809,
"learning_rate": 0.00012870942563938264,
"loss": 0.323,
"mean_token_accuracy": 0.9175428152084351,
"num_tokens": 4673599.0,
"step": 169
},
{
"epoch": 2.151898734177215,
"grad_norm": 0.2501348853111267,
"learning_rate": 0.0001279227404502709,
"loss": 0.3163,
"mean_token_accuracy": 0.9166937470436096,
"num_tokens": 4701380.0,
"step": 170
},
{
"epoch": 2.1645569620253164,
"grad_norm": 0.22692376375198364,
"learning_rate": 0.00012713417655957376,
"loss": 0.2759,
"mean_token_accuracy": 0.9288318753242493,
"num_tokens": 4726947.0,
"step": 171
},
{
"epoch": 2.1772151898734178,
"grad_norm": 0.2650166451931,
"learning_rate": 0.00012634378702355313,
"loss": 0.2903,
"mean_token_accuracy": 0.9228612184524536,
"num_tokens": 4750190.0,
"step": 172
},
{
"epoch": 2.189873417721519,
"grad_norm": 0.2699657678604126,
"learning_rate": 0.00012555162502130433,
"loss": 0.3415,
"mean_token_accuracy": 0.9156725406646729,
"num_tokens": 4780683.0,
"step": 173
},
{
"epoch": 2.2025316455696204,
"grad_norm": 0.27826425433158875,
"learning_rate": 0.00012475774385117786,
"loss": 0.2964,
"mean_token_accuracy": 0.9242163300514221,
"num_tokens": 4809170.0,
"step": 174
},
{
"epoch": 2.2151898734177213,
"grad_norm": 0.2556692361831665,
"learning_rate": 0.00012396219692719363,
"loss": 0.2999,
"mean_token_accuracy": 0.9241935610771179,
"num_tokens": 4840234.0,
"step": 175
},
{
"epoch": 2.2278481012658227,
"grad_norm": 0.2634039521217346,
"learning_rate": 0.000123165037775447,
"loss": 0.2831,
"mean_token_accuracy": 0.928834855556488,
"num_tokens": 4871212.0,
"step": 176
},
{
"epoch": 2.240506329113924,
"grad_norm": 0.24299867451190948,
"learning_rate": 0.00012236632003050736,
"loss": 0.3104,
"mean_token_accuracy": 0.9202462434768677,
"num_tokens": 4899864.0,
"step": 177
},
{
"epoch": 2.2531645569620253,
"grad_norm": 0.27710238099098206,
"learning_rate": 0.00012156609743180969,
"loss": 0.3277,
"mean_token_accuracy": 0.916947603225708,
"num_tokens": 4923660.0,
"step": 178
},
{
"epoch": 2.2658227848101267,
"grad_norm": 0.26420897245407104,
"learning_rate": 0.0001207644238200387,
"loss": 0.3226,
"mean_token_accuracy": 0.9189229607582092,
"num_tokens": 4950316.0,
"step": 179
},
{
"epoch": 2.278481012658228,
"grad_norm": 0.24535071849822998,
"learning_rate": 0.00011996135313350636,
"loss": 0.3358,
"mean_token_accuracy": 0.9146915674209595,
"num_tokens": 4976919.0,
"step": 180
},
{
"epoch": 2.291139240506329,
"grad_norm": 0.2273595929145813,
"learning_rate": 0.0001191569394045228,
"loss": 0.3158,
"mean_token_accuracy": 0.9169893264770508,
"num_tokens": 5007461.0,
"step": 181
},
{
"epoch": 2.3037974683544302,
"grad_norm": 0.2287990301847458,
"learning_rate": 0.00011835123675576092,
"loss": 0.3074,
"mean_token_accuracy": 0.9208506345748901,
"num_tokens": 5038138.0,
"step": 182
},
{
"epoch": 2.3164556962025316,
"grad_norm": 0.27022621035575867,
"learning_rate": 0.0001175442993966149,
"loss": 0.365,
"mean_token_accuracy": 0.9085253477096558,
"num_tokens": 5065368.0,
"step": 183
},
{
"epoch": 2.329113924050633,
"grad_norm": 0.27093011140823364,
"learning_rate": 0.00011673618161955288,
"loss": 0.2812,
"mean_token_accuracy": 0.9275172352790833,
"num_tokens": 5093618.0,
"step": 184
},
{
"epoch": 2.3417721518987342,
"grad_norm": 0.2677018642425537,
"learning_rate": 0.00011592693779646405,
"loss": 0.3154,
"mean_token_accuracy": 0.9172254800796509,
"num_tokens": 5122314.0,
"step": 185
},
{
"epoch": 2.3544303797468356,
"grad_norm": 0.28765732049942017,
"learning_rate": 0.00011511662237500032,
"loss": 0.2979,
"mean_token_accuracy": 0.920109748840332,
"num_tokens": 5151906.0,
"step": 186
},
{
"epoch": 2.367088607594937,
"grad_norm": 0.2899748384952545,
"learning_rate": 0.00011430528987491305,
"loss": 0.3114,
"mean_token_accuracy": 0.9213389754295349,
"num_tokens": 5183218.0,
"step": 187
},
{
"epoch": 2.379746835443038,
"grad_norm": 0.2758501470088959,
"learning_rate": 0.00011349299488438485,
"loss": 0.3214,
"mean_token_accuracy": 0.9202250242233276,
"num_tokens": 5207099.0,
"step": 188
},
{
"epoch": 2.392405063291139,
"grad_norm": 0.26853853464126587,
"learning_rate": 0.00011267979205635675,
"loss": 0.288,
"mean_token_accuracy": 0.9245320558547974,
"num_tokens": 5232114.0,
"step": 189
},
{
"epoch": 2.4050632911392404,
"grad_norm": 0.25736933946609497,
"learning_rate": 0.00011186573610485098,
"loss": 0.3346,
"mean_token_accuracy": 0.9166609644889832,
"num_tokens": 5261288.0,
"step": 190
},
{
"epoch": 2.4177215189873418,
"grad_norm": 0.2637197971343994,
"learning_rate": 0.00011105088180128976,
"loss": 0.3661,
"mean_token_accuracy": 0.9097849726676941,
"num_tokens": 5289906.0,
"step": 191
},
{
"epoch": 2.430379746835443,
"grad_norm": 0.2588805854320526,
"learning_rate": 0.00011023528397081011,
"loss": 0.3093,
"mean_token_accuracy": 0.9212461709976196,
"num_tokens": 5317575.0,
"step": 192
},
{
"epoch": 2.4430379746835444,
"grad_norm": 0.25420597195625305,
"learning_rate": 0.0001094189974885752,
"loss": 0.2949,
"mean_token_accuracy": 0.9249463677406311,
"num_tokens": 5344220.0,
"step": 193
},
{
"epoch": 2.4556962025316453,
"grad_norm": 0.23094050586223602,
"learning_rate": 0.00010860207727608214,
"loss": 0.2978,
"mean_token_accuracy": 0.9216447472572327,
"num_tokens": 5376994.0,
"step": 194
},
{
"epoch": 2.4683544303797467,
"grad_norm": 0.26487165689468384,
"learning_rate": 0.00010778457829746666,
"loss": 0.3375,
"mean_token_accuracy": 0.9163733124732971,
"num_tokens": 5406032.0,
"step": 195
},
{
"epoch": 2.481012658227848,
"grad_norm": 0.26758190989494324,
"learning_rate": 0.00010696655555580524,
"loss": 0.3016,
"mean_token_accuracy": 0.9225262403488159,
"num_tokens": 5432079.0,
"step": 196
},
{
"epoch": 2.4936708860759493,
"grad_norm": 0.24040226638317108,
"learning_rate": 0.00010614806408941422,
"loss": 0.3005,
"mean_token_accuracy": 0.9199211001396179,
"num_tokens": 5460028.0,
"step": 197
},
{
"epoch": 2.5063291139240507,
"grad_norm": 0.24399694800376892,
"learning_rate": 0.00010532915896814672,
"loss": 0.3154,
"mean_token_accuracy": 0.9223917722702026,
"num_tokens": 5490630.0,
"step": 198
},
{
"epoch": 2.518987341772152,
"grad_norm": 0.25092339515686035,
"learning_rate": 0.00010450989528968746,
"loss": 0.3155,
"mean_token_accuracy": 0.9183499217033386,
"num_tokens": 5520002.0,
"step": 199
},
{
"epoch": 2.5316455696202533,
"grad_norm": 0.3188228905200958,
"learning_rate": 0.00010369032817584561,
"loss": 0.3576,
"mean_token_accuracy": 0.9120784401893616,
"num_tokens": 5543314.0,
"step": 200
},
{
"epoch": 2.5443037974683547,
"grad_norm": 0.25112369656562805,
"learning_rate": 0.00010287051276884618,
"loss": 0.3232,
"mean_token_accuracy": 0.9183758497238159,
"num_tokens": 5576922.0,
"step": 201
},
{
"epoch": 2.5569620253164556,
"grad_norm": 0.2742134630680084,
"learning_rate": 0.00010205050422761988,
"loss": 0.3443,
"mean_token_accuracy": 0.9113529920578003,
"num_tokens": 5604274.0,
"step": 202
},
{
"epoch": 2.569620253164557,
"grad_norm": 0.26450711488723755,
"learning_rate": 0.00010123035772409184,
"loss": 0.3138,
"mean_token_accuracy": 0.9207383990287781,
"num_tokens": 5629962.0,
"step": 203
},
{
"epoch": 2.5822784810126582,
"grad_norm": 0.284280002117157,
"learning_rate": 0.0001004101284394696,
"loss": 0.3381,
"mean_token_accuracy": 0.914824903011322,
"num_tokens": 5657898.0,
"step": 204
},
{
"epoch": 2.5949367088607596,
"grad_norm": 0.25629135966300964,
"learning_rate": 9.958987156053045e-05,
"loss": 0.3072,
"mean_token_accuracy": 0.9197523593902588,
"num_tokens": 5684455.0,
"step": 205
},
{
"epoch": 2.607594936708861,
"grad_norm": 0.2606535255908966,
"learning_rate": 9.87696422759082e-05,
"loss": 0.3119,
"mean_token_accuracy": 0.9206276535987854,
"num_tokens": 5712942.0,
"step": 206
},
{
"epoch": 2.620253164556962,
"grad_norm": 0.3131278455257416,
"learning_rate": 9.794949577238013e-05,
"loss": 0.3396,
"mean_token_accuracy": 0.9145336151123047,
"num_tokens": 5736173.0,
"step": 207
},
{
"epoch": 2.632911392405063,
"grad_norm": 0.28028929233551025,
"learning_rate": 9.712948723115383e-05,
"loss": 0.3235,
"mean_token_accuracy": 0.9198562502861023,
"num_tokens": 5764898.0,
"step": 208
},
{
"epoch": 2.6455696202531644,
"grad_norm": 0.3018859028816223,
"learning_rate": 9.630967182415442e-05,
"loss": 0.3416,
"mean_token_accuracy": 0.9144072532653809,
"num_tokens": 5788235.0,
"step": 209
},
{
"epoch": 2.6582278481012658,
"grad_norm": 0.2701573371887207,
"learning_rate": 9.549010471031256e-05,
"loss": 0.3322,
"mean_token_accuracy": 0.9136073589324951,
"num_tokens": 5815593.0,
"step": 210
},
{
"epoch": 2.670886075949367,
"grad_norm": 0.27918487787246704,
"learning_rate": 9.467084103185329e-05,
"loss": 0.2871,
"mean_token_accuracy": 0.9251144528388977,
"num_tokens": 5839026.0,
"step": 211
},
{
"epoch": 2.6835443037974684,
"grad_norm": 0.2541793882846832,
"learning_rate": 9.385193591058579e-05,
"loss": 0.3207,
"mean_token_accuracy": 0.9179412126541138,
"num_tokens": 5868447.0,
"step": 212
},
{
"epoch": 2.6962025316455698,
"grad_norm": 0.284212201833725,
"learning_rate": 9.303344444419476e-05,
"loss": 0.3418,
"mean_token_accuracy": 0.9152814745903015,
"num_tokens": 5892154.0,
"step": 213
},
{
"epoch": 2.708860759493671,
"grad_norm": 0.25230202078819275,
"learning_rate": 9.221542170253339e-05,
"loss": 0.324,
"mean_token_accuracy": 0.918138861656189,
"num_tokens": 5920803.0,
"step": 214
},
{
"epoch": 2.721518987341772,
"grad_norm": 0.25568363070487976,
"learning_rate": 9.139792272391791e-05,
"loss": 0.3217,
"mean_token_accuracy": 0.9202106595039368,
"num_tokens": 5948590.0,
"step": 215
},
{
"epoch": 2.7341772151898733,
"grad_norm": 0.27856069803237915,
"learning_rate": 9.058100251142483e-05,
"loss": 0.3423,
"mean_token_accuracy": 0.9158259034156799,
"num_tokens": 5975218.0,
"step": 216
},
{
"epoch": 2.7468354430379747,
"grad_norm": 0.28674831986427307,
"learning_rate": 8.976471602918991e-05,
"loss": 0.3211,
"mean_token_accuracy": 0.9169238209724426,
"num_tokens": 5999260.0,
"step": 217
},
{
"epoch": 2.759493670886076,
"grad_norm": 0.2633654475212097,
"learning_rate": 8.894911819871026e-05,
"loss": 0.3001,
"mean_token_accuracy": 0.9245463013648987,
"num_tokens": 6025499.0,
"step": 218
},
{
"epoch": 2.7721518987341773,
"grad_norm": 0.27216392755508423,
"learning_rate": 8.813426389514903e-05,
"loss": 0.3121,
"mean_token_accuracy": 0.9205847382545471,
"num_tokens": 6052447.0,
"step": 219
},
{
"epoch": 2.7848101265822782,
"grad_norm": 0.27877405285835266,
"learning_rate": 8.732020794364326e-05,
"loss": 0.3115,
"mean_token_accuracy": 0.9189746379852295,
"num_tokens": 6077244.0,
"step": 220
},
{
"epoch": 2.7974683544303796,
"grad_norm": 0.24932622909545898,
"learning_rate": 8.650700511561514e-05,
"loss": 0.3044,
"mean_token_accuracy": 0.9242026805877686,
"num_tokens": 6107784.0,
"step": 221
},
{
"epoch": 2.810126582278481,
"grad_norm": 0.2901391088962555,
"learning_rate": 8.5694710125087e-05,
"loss": 0.3463,
"mean_token_accuracy": 0.913219153881073,
"num_tokens": 6131851.0,
"step": 222
},
{
"epoch": 2.8227848101265822,
"grad_norm": 0.25400716066360474,
"learning_rate": 8.488337762499972e-05,
"loss": 0.3237,
"mean_token_accuracy": 0.9190093874931335,
"num_tokens": 6162079.0,
"step": 223
},
{
"epoch": 2.8354430379746836,
"grad_norm": 0.28880804777145386,
"learning_rate": 8.407306220353596e-05,
"loss": 0.2961,
"mean_token_accuracy": 0.9268283247947693,
"num_tokens": 6188779.0,
"step": 224
},
{
"epoch": 2.848101265822785,
"grad_norm": 0.2607930600643158,
"learning_rate": 8.326381838044713e-05,
"loss": 0.2939,
"mean_token_accuracy": 0.9244282841682434,
"num_tokens": 6215255.0,
"step": 225
},
{
"epoch": 2.8607594936708862,
"grad_norm": 0.25856783986091614,
"learning_rate": 8.245570060338512e-05,
"loss": 0.3216,
"mean_token_accuracy": 0.9173731207847595,
"num_tokens": 6243276.0,
"step": 226
},
{
"epoch": 2.8734177215189876,
"grad_norm": 0.2345365434885025,
"learning_rate": 8.164876324423909e-05,
"loss": 0.2951,
"mean_token_accuracy": 0.9234026670455933,
"num_tokens": 6275456.0,
"step": 227
},
{
"epoch": 2.8860759493670884,
"grad_norm": 0.307713121175766,
"learning_rate": 8.084306059547722e-05,
"loss": 0.3493,
"mean_token_accuracy": 0.9130492806434631,
"num_tokens": 6298073.0,
"step": 228
},
{
"epoch": 2.8987341772151898,
"grad_norm": 0.22503980994224548,
"learning_rate": 8.003864686649366e-05,
"loss": 0.2865,
"mean_token_accuracy": 0.9234779477119446,
"num_tokens": 6329788.0,
"step": 229
},
{
"epoch": 2.911392405063291,
"grad_norm": 0.2680565118789673,
"learning_rate": 7.923557617996131e-05,
"loss": 0.3342,
"mean_token_accuracy": 0.912935733795166,
"num_tokens": 6355672.0,
"step": 230
},
{
"epoch": 2.9240506329113924,
"grad_norm": 0.24028684198856354,
"learning_rate": 7.843390256819034e-05,
"loss": 0.3245,
"mean_token_accuracy": 0.9167670607566833,
"num_tokens": 6388944.0,
"step": 231
},
{
"epoch": 2.9367088607594938,
"grad_norm": 0.2594313323497772,
"learning_rate": 7.763367996949267e-05,
"loss": 0.3122,
"mean_token_accuracy": 0.919628918170929,
"num_tokens": 6415311.0,
"step": 232
},
{
"epoch": 2.9493670886075947,
"grad_norm": 0.26911094784736633,
"learning_rate": 7.683496222455304e-05,
"loss": 0.2932,
"mean_token_accuracy": 0.9235373735427856,
"num_tokens": 6445612.0,
"step": 233
},
{
"epoch": 2.962025316455696,
"grad_norm": 0.2445937991142273,
"learning_rate": 7.603780307280639e-05,
"loss": 0.3075,
"mean_token_accuracy": 0.921126127243042,
"num_tokens": 6477892.0,
"step": 234
},
{
"epoch": 2.9746835443037973,
"grad_norm": 0.24366585910320282,
"learning_rate": 7.524225614882216e-05,
"loss": 0.3063,
"mean_token_accuracy": 0.9189066886901855,
"num_tokens": 6511103.0,
"step": 235
},
{
"epoch": 2.9873417721518987,
"grad_norm": 0.2565755248069763,
"learning_rate": 7.44483749786957e-05,
"loss": 0.3173,
"mean_token_accuracy": 0.9204142689704895,
"num_tokens": 6544188.0,
"step": 236
},
{
"epoch": 3.0,
"grad_norm": 0.2904413640499115,
"learning_rate": 7.365621297644686e-05,
"loss": 0.2312,
"mean_token_accuracy": 0.9368520975112915,
"num_tokens": 6563160.0,
"step": 237
},
{
"epoch": 3.0126582278481013,
"grad_norm": 0.27616387605667114,
"learning_rate": 7.286582344042625e-05,
"loss": 0.2444,
"mean_token_accuracy": 0.9391213059425354,
"num_tokens": 6592676.0,
"step": 238
},
{
"epoch": 3.0253164556962027,
"grad_norm": 0.22310671210289001,
"learning_rate": 7.207725954972913e-05,
"loss": 0.2059,
"mean_token_accuracy": 0.9484432339668274,
"num_tokens": 6622513.0,
"step": 239
},
{
"epoch": 3.037974683544304,
"grad_norm": 0.23881305754184723,
"learning_rate": 7.129057436061739e-05,
"loss": 0.1847,
"mean_token_accuracy": 0.9508729577064514,
"num_tokens": 6648408.0,
"step": 240
},
{
"epoch": 3.050632911392405,
"grad_norm": 0.26994800567626953,
"learning_rate": 7.050582080294996e-05,
"loss": 0.2262,
"mean_token_accuracy": 0.9404712319374084,
"num_tokens": 6677248.0,
"step": 241
},
{
"epoch": 3.0632911392405062,
"grad_norm": 0.33617740869522095,
"learning_rate": 6.972305167662145e-05,
"loss": 0.2183,
"mean_token_accuracy": 0.9411532282829285,
"num_tokens": 6702632.0,
"step": 242
},
{
"epoch": 3.0759493670886076,
"grad_norm": 0.3962535560131073,
"learning_rate": 6.89423196480097e-05,
"loss": 0.235,
"mean_token_accuracy": 0.9364402890205383,
"num_tokens": 6723574.0,
"step": 243
},
{
"epoch": 3.088607594936709,
"grad_norm": 0.3901783227920532,
"learning_rate": 6.816367724643224e-05,
"loss": 0.2112,
"mean_token_accuracy": 0.9436113834381104,
"num_tokens": 6753715.0,
"step": 244
},
{
"epoch": 3.1012658227848102,
"grad_norm": 0.42895060777664185,
"learning_rate": 6.738717686061206e-05,
"loss": 0.2142,
"mean_token_accuracy": 0.9432305097579956,
"num_tokens": 6782016.0,
"step": 245
},
{
"epoch": 3.1139240506329116,
"grad_norm": 0.3753194212913513,
"learning_rate": 6.661287073515275e-05,
"loss": 0.2079,
"mean_token_accuracy": 0.9462132453918457,
"num_tokens": 6810191.0,
"step": 246
},
{
"epoch": 3.1265822784810124,
"grad_norm": 0.3014523386955261,
"learning_rate": 6.58408109670234e-05,
"loss": 0.1745,
"mean_token_accuracy": 0.9523671865463257,
"num_tokens": 6837946.0,
"step": 247
},
{
"epoch": 3.1392405063291138,
"grad_norm": 0.2990639805793762,
"learning_rate": 6.507104950205336e-05,
"loss": 0.2133,
"mean_token_accuracy": 0.9442956447601318,
"num_tokens": 6865638.0,
"step": 248
},
{
"epoch": 3.151898734177215,
"grad_norm": 0.2579714357852936,
"learning_rate": 6.430363813143716e-05,
"loss": 0.2133,
"mean_token_accuracy": 0.943679690361023,
"num_tokens": 6897449.0,
"step": 249
},
{
"epoch": 3.1645569620253164,
"grad_norm": 0.2432967573404312,
"learning_rate": 6.35386284882501e-05,
"loss": 0.2231,
"mean_token_accuracy": 0.9416444897651672,
"num_tokens": 6930569.0,
"step": 250
},
{
"epoch": 3.1772151898734178,
"grad_norm": 0.27149054408073425,
"learning_rate": 6.277607204397408e-05,
"loss": 0.2242,
"mean_token_accuracy": 0.9404853582382202,
"num_tokens": 6960508.0,
"step": 251
},
{
"epoch": 3.189873417721519,
"grad_norm": 0.26167789101600647,
"learning_rate": 6.201602010503454e-05,
"loss": 0.1878,
"mean_token_accuracy": 0.949936032295227,
"num_tokens": 6985580.0,
"step": 252
},
{
"epoch": 3.2025316455696204,
"grad_norm": 0.2881351113319397,
"learning_rate": 6.125852380934841e-05,
"loss": 0.209,
"mean_token_accuracy": 0.9419926404953003,
"num_tokens": 7010365.0,
"step": 253
},
{
"epoch": 3.2151898734177213,
"grad_norm": 0.2717518210411072,
"learning_rate": 6.0503634122883556e-05,
"loss": 0.2127,
"mean_token_accuracy": 0.9436876177787781,
"num_tokens": 7042802.0,
"step": 254
},
{
"epoch": 3.2278481012658227,
"grad_norm": 0.2932974100112915,
"learning_rate": 5.975140183622958e-05,
"loss": 0.2408,
"mean_token_accuracy": 0.936859130859375,
"num_tokens": 7071342.0,
"step": 255
},
{
"epoch": 3.240506329113924,
"grad_norm": 0.3055175244808197,
"learning_rate": 5.900187756118055e-05,
"loss": 0.2171,
"mean_token_accuracy": 0.941013514995575,
"num_tokens": 7102091.0,
"step": 256
},
{
"epoch": 3.2531645569620253,
"grad_norm": 0.3924141526222229,
"learning_rate": 5.8255111727329717e-05,
"loss": 0.2121,
"mean_token_accuracy": 0.9423477649688721,
"num_tokens": 7126161.0,
"step": 257
},
{
"epoch": 3.2658227848101267,
"grad_norm": 0.3086543083190918,
"learning_rate": 5.751115457867653e-05,
"loss": 0.2009,
"mean_token_accuracy": 0.9472497701644897,
"num_tokens": 7159495.0,
"step": 258
},
{
"epoch": 3.278481012658228,
"grad_norm": 0.3455684185028076,
"learning_rate": 5.6770056170246175e-05,
"loss": 0.2062,
"mean_token_accuracy": 0.9483978152275085,
"num_tokens": 7188395.0,
"step": 259
},
{
"epoch": 3.291139240506329,
"grad_norm": 0.30978819727897644,
"learning_rate": 5.6031866364721554e-05,
"loss": 0.1889,
"mean_token_accuracy": 0.9461386203765869,
"num_tokens": 7217775.0,
"step": 260
},
{
"epoch": 3.3037974683544302,
"grad_norm": 0.3556048572063446,
"learning_rate": 5.529663482908864e-05,
"loss": 0.2091,
"mean_token_accuracy": 0.9441432952880859,
"num_tokens": 7241453.0,
"step": 261
},
{
"epoch": 3.3164556962025316,
"grad_norm": 0.33020082116127014,
"learning_rate": 5.4564411031294695e-05,
"loss": 0.22,
"mean_token_accuracy": 0.9420092701911926,
"num_tokens": 7265038.0,
"step": 262
},
{
"epoch": 3.329113924050633,
"grad_norm": 0.2814682424068451,
"learning_rate": 5.383524423691994e-05,
"loss": 0.2165,
"mean_token_accuracy": 0.9420244097709656,
"num_tokens": 7296598.0,
"step": 263
},
{
"epoch": 3.3417721518987342,
"grad_norm": 0.30232468247413635,
"learning_rate": 5.310918350586291e-05,
"loss": 0.2237,
"mean_token_accuracy": 0.9408864974975586,
"num_tokens": 7323847.0,
"step": 264
},
{
"epoch": 3.3544303797468356,
"grad_norm": 0.3444303870201111,
"learning_rate": 5.2386277689039565e-05,
"loss": 0.2359,
"mean_token_accuracy": 0.9386903643608093,
"num_tokens": 7349796.0,
"step": 265
},
{
"epoch": 3.367088607594937,
"grad_norm": 0.27576106786727905,
"learning_rate": 5.1666575425096396e-05,
"loss": 0.2028,
"mean_token_accuracy": 0.9470149278640747,
"num_tokens": 7381869.0,
"step": 266
},
{
"epoch": 3.379746835443038,
"grad_norm": 0.264581561088562,
"learning_rate": 5.095012513713815e-05,
"loss": 0.1836,
"mean_token_accuracy": 0.9481507539749146,
"num_tokens": 7410323.0,
"step": 267
},
{
"epoch": 3.392405063291139,
"grad_norm": 0.2806169092655182,
"learning_rate": 5.023697502946969e-05,
"loss": 0.2211,
"mean_token_accuracy": 0.9417513608932495,
"num_tokens": 7443538.0,
"step": 268
},
{
"epoch": 3.4050632911392404,
"grad_norm": 0.3141394853591919,
"learning_rate": 4.9527173084352544e-05,
"loss": 0.2092,
"mean_token_accuracy": 0.9468376636505127,
"num_tokens": 7472062.0,
"step": 269
},
{
"epoch": 3.4177215189873418,
"grad_norm": 0.3401537537574768,
"learning_rate": 4.882076705877689e-05,
"loss": 0.2296,
"mean_token_accuracy": 0.9416146874427795,
"num_tokens": 7495214.0,
"step": 270
},
{
"epoch": 3.430379746835443,
"grad_norm": 0.3027495741844177,
"learning_rate": 4.811780448124812e-05,
"loss": 0.1805,
"mean_token_accuracy": 0.9496809840202332,
"num_tokens": 7524273.0,
"step": 271
},
{
"epoch": 3.4430379746835444,
"grad_norm": 0.31691181659698486,
"learning_rate": 4.741833264858909e-05,
"loss": 0.2165,
"mean_token_accuracy": 0.9446760416030884,
"num_tokens": 7550004.0,
"step": 272
},
{
"epoch": 3.4556962025316453,
"grad_norm": 0.349369615316391,
"learning_rate": 4.6722398622757935e-05,
"loss": 0.2351,
"mean_token_accuracy": 0.937907874584198,
"num_tokens": 7576577.0,
"step": 273
},
{
"epoch": 3.4683544303797467,
"grad_norm": 0.32902660965919495,
"learning_rate": 4.603004922768148e-05,
"loss": 0.2186,
"mean_token_accuracy": 0.9428966045379639,
"num_tokens": 7604888.0,
"step": 274
},
{
"epoch": 3.481012658227848,
"grad_norm": 0.3392826020717621,
"learning_rate": 4.5341331046105064e-05,
"loss": 0.1997,
"mean_token_accuracy": 0.9449344277381897,
"num_tokens": 7632392.0,
"step": 275
},
{
"epoch": 3.4936708860759493,
"grad_norm": 0.31181755661964417,
"learning_rate": 4.465629041645819e-05,
"loss": 0.2147,
"mean_token_accuracy": 0.9431726336479187,
"num_tokens": 7660893.0,
"step": 276
},
{
"epoch": 3.5063291139240507,
"grad_norm": 0.3440548777580261,
"learning_rate": 4.397497342973676e-05,
"loss": 0.2351,
"mean_token_accuracy": 0.93739253282547,
"num_tokens": 7684804.0,
"step": 277
},
{
"epoch": 3.518987341772152,
"grad_norm": 0.3588908016681671,
"learning_rate": 4.3297425926402115e-05,
"loss": 0.2077,
"mean_token_accuracy": 0.9441769123077393,
"num_tokens": 7707296.0,
"step": 278
},
{
"epoch": 3.5316455696202533,
"grad_norm": 0.3143376111984253,
"learning_rate": 4.2623693493296644e-05,
"loss": 0.2178,
"mean_token_accuracy": 0.9430637955665588,
"num_tokens": 7734320.0,
"step": 279
},
{
"epoch": 3.5443037974683547,
"grad_norm": 0.3187249004840851,
"learning_rate": 4.1953821460576715e-05,
"loss": 0.2153,
"mean_token_accuracy": 0.9420468211174011,
"num_tokens": 7759594.0,
"step": 280
},
{
"epoch": 3.5569620253164556,
"grad_norm": 0.3404756486415863,
"learning_rate": 4.1287854898662705e-05,
"loss": 0.2191,
"mean_token_accuracy": 0.9429894089698792,
"num_tokens": 7784934.0,
"step": 281
},
{
"epoch": 3.569620253164557,
"grad_norm": 0.2950340211391449,
"learning_rate": 4.0625838615206566e-05,
"loss": 0.1965,
"mean_token_accuracy": 0.9470370411872864,
"num_tokens": 7813905.0,
"step": 282
},
{
"epoch": 3.5822784810126582,
"grad_norm": 0.29675501585006714,
"learning_rate": 3.996781715207706e-05,
"loss": 0.1883,
"mean_token_accuracy": 0.9523015022277832,
"num_tokens": 7842733.0,
"step": 283
},
{
"epoch": 3.5949367088607596,
"grad_norm": 0.2913971245288849,
"learning_rate": 3.9313834782362926e-05,
"loss": 0.2062,
"mean_token_accuracy": 0.9438738226890564,
"num_tokens": 7870057.0,
"step": 284
},
{
"epoch": 3.607594936708861,
"grad_norm": 0.3250754177570343,
"learning_rate": 3.866393550739416e-05,
"loss": 0.2152,
"mean_token_accuracy": 0.9438368678092957,
"num_tokens": 7899838.0,
"step": 285
},
{
"epoch": 3.620253164556962,
"grad_norm": 0.3587188422679901,
"learning_rate": 3.801816305378124e-05,
"loss": 0.2133,
"mean_token_accuracy": 0.9447436928749084,
"num_tokens": 7927193.0,
"step": 286
},
{
"epoch": 3.632911392405063,
"grad_norm": 0.3460696041584015,
"learning_rate": 3.737656087047347e-05,
"loss": 0.2206,
"mean_token_accuracy": 0.9417229294776917,
"num_tokens": 7954815.0,
"step": 287
},
{
"epoch": 3.6455696202531644,
"grad_norm": 0.3258835971355438,
"learning_rate": 3.673917212583538e-05,
"loss": 0.1926,
"mean_token_accuracy": 0.9482221007347107,
"num_tokens": 7981512.0,
"step": 288
},
{
"epoch": 3.6582278481012658,
"grad_norm": 0.30438584089279175,
"learning_rate": 3.610603970474239e-05,
"loss": 0.188,
"mean_token_accuracy": 0.9465112090110779,
"num_tokens": 8009881.0,
"step": 289
},
{
"epoch": 3.670886075949367,
"grad_norm": 0.32022497057914734,
"learning_rate": 3.547720620569539e-05,
"loss": 0.2302,
"mean_token_accuracy": 0.9406543970108032,
"num_tokens": 8036535.0,
"step": 290
},
{
"epoch": 3.6835443037974684,
"grad_norm": 0.31502029299736023,
"learning_rate": 3.485271393795453e-05,
"loss": 0.2027,
"mean_token_accuracy": 0.945996105670929,
"num_tokens": 8065708.0,
"step": 291
},
{
"epoch": 3.6962025316455698,
"grad_norm": 0.33635619282722473,
"learning_rate": 3.4232604918692754e-05,
"loss": 0.186,
"mean_token_accuracy": 0.949739396572113,
"num_tokens": 8095895.0,
"step": 292
},
{
"epoch": 3.708860759493671,
"grad_norm": 0.28580737113952637,
"learning_rate": 3.361692087016863e-05,
"loss": 0.2055,
"mean_token_accuracy": 0.9459794163703918,
"num_tokens": 8130668.0,
"step": 293
},
{
"epoch": 3.721518987341772,
"grad_norm": 0.3191229999065399,
"learning_rate": 3.300570321691934e-05,
"loss": 0.2276,
"mean_token_accuracy": 0.9415168166160583,
"num_tokens": 8159424.0,
"step": 294
},
{
"epoch": 3.7341772151898733,
"grad_norm": 0.3334013819694519,
"learning_rate": 3.2398993082973294e-05,
"loss": 0.2059,
"mean_token_accuracy": 0.9460656642913818,
"num_tokens": 8185223.0,
"step": 295
},
{
"epoch": 3.7468354430379747,
"grad_norm": 0.3282049298286438,
"learning_rate": 3.179683128908352e-05,
"loss": 0.1981,
"mean_token_accuracy": 0.9463132619857788,
"num_tokens": 8210526.0,
"step": 296
},
{
"epoch": 3.759493670886076,
"grad_norm": 0.32919394969940186,
"learning_rate": 3.1199258349980966e-05,
"loss": 0.2027,
"mean_token_accuracy": 0.9434241056442261,
"num_tokens": 8234275.0,
"step": 297
},
{
"epoch": 3.7721518987341773,
"grad_norm": 0.30664342641830444,
"learning_rate": 3.0606314471648643e-05,
"loss": 0.225,
"mean_token_accuracy": 0.9425418972969055,
"num_tokens": 8264065.0,
"step": 298
},
{
"epoch": 3.7848101265822782,
"grad_norm": 0.3123731017112732,
"learning_rate": 3.0018039548616494e-05,
"loss": 0.2136,
"mean_token_accuracy": 0.9409631490707397,
"num_tokens": 8289774.0,
"step": 299
},
{
"epoch": 3.7974683544303796,
"grad_norm": 0.28892743587493896,
"learning_rate": 2.943447316127712e-05,
"loss": 0.2149,
"mean_token_accuracy": 0.9433043599128723,
"num_tokens": 8318588.0,
"step": 300
},
{
"epoch": 3.810126582278481,
"grad_norm": 0.3019264340400696,
"learning_rate": 2.8855654573222825e-05,
"loss": 0.1967,
"mean_token_accuracy": 0.9472973942756653,
"num_tokens": 8342370.0,
"step": 301
},
{
"epoch": 3.8227848101265822,
"grad_norm": 0.34315142035484314,
"learning_rate": 2.8281622728603864e-05,
"loss": 0.2246,
"mean_token_accuracy": 0.9393528699874878,
"num_tokens": 8368272.0,
"step": 302
},
{
"epoch": 3.8354430379746836,
"grad_norm": 0.28530240058898926,
"learning_rate": 2.7712416249508177e-05,
"loss": 0.1843,
"mean_token_accuracy": 0.9489932060241699,
"num_tokens": 8393862.0,
"step": 303
},
{
"epoch": 3.848101265822785,
"grad_norm": 0.29711446166038513,
"learning_rate": 2.714807343336273e-05,
"loss": 0.193,
"mean_token_accuracy": 0.9491274356842041,
"num_tokens": 8427677.0,
"step": 304
},
{
"epoch": 3.8607594936708862,
"grad_norm": 0.3001667261123657,
"learning_rate": 2.6588632250356948e-05,
"loss": 0.2135,
"mean_token_accuracy": 0.942951500415802,
"num_tokens": 8456804.0,
"step": 305
},
{
"epoch": 3.8734177215189876,
"grad_norm": 0.370648592710495,
"learning_rate": 2.6034130340887895e-05,
"loss": 0.228,
"mean_token_accuracy": 0.9391285181045532,
"num_tokens": 8479473.0,
"step": 306
},
{
"epoch": 3.8860759493670884,
"grad_norm": 0.29396143555641174,
"learning_rate": 2.5484605013027784e-05,
"loss": 0.1875,
"mean_token_accuracy": 0.9490495324134827,
"num_tokens": 8509311.0,
"step": 307
},
{
"epoch": 3.8987341772151898,
"grad_norm": 0.3296216130256653,
"learning_rate": 2.4940093240013717e-05,
"loss": 0.218,
"mean_token_accuracy": 0.9419081807136536,
"num_tokens": 8532769.0,
"step": 308
},
{
"epoch": 3.911392405063291,
"grad_norm": 0.32734474539756775,
"learning_rate": 2.4400631657760186e-05,
"loss": 0.2283,
"mean_token_accuracy": 0.9447795748710632,
"num_tokens": 8562007.0,
"step": 309
},
{
"epoch": 3.9240506329113924,
"grad_norm": 0.3589797616004944,
"learning_rate": 2.3866256562394083e-05,
"loss": 0.2069,
"mean_token_accuracy": 0.9477079510688782,
"num_tokens": 8588423.0,
"step": 310
},
{
"epoch": 3.9367088607594938,
"grad_norm": 0.34904512763023376,
"learning_rate": 2.333700390781256e-05,
"loss": 0.2378,
"mean_token_accuracy": 0.9371540546417236,
"num_tokens": 8612514.0,
"step": 311
},
{
"epoch": 3.9493670886075947,
"grad_norm": 0.3251732587814331,
"learning_rate": 2.2812909303264085e-05,
"loss": 0.2197,
"mean_token_accuracy": 0.9419779777526855,
"num_tokens": 8638999.0,
"step": 312
},
{
"epoch": 3.962025316455696,
"grad_norm": 0.2840147912502289,
"learning_rate": 2.2294008010952382e-05,
"loss": 0.1916,
"mean_token_accuracy": 0.9481982588768005,
"num_tokens": 8668618.0,
"step": 313
},
{
"epoch": 3.9746835443037973,
"grad_norm": 0.3017045557498932,
"learning_rate": 2.1780334943664162e-05,
"loss": 0.2325,
"mean_token_accuracy": 0.9411991238594055,
"num_tokens": 8697253.0,
"step": 314
},
{
"epoch": 3.9873417721518987,
"grad_norm": 0.3263002932071686,
"learning_rate": 2.127192466241994e-05,
"loss": 0.1968,
"mean_token_accuracy": 0.9472008347511292,
"num_tokens": 8725272.0,
"step": 315
},
{
"epoch": 4.0,
"grad_norm": 0.26912280917167664,
"learning_rate": 2.07688113741488e-05,
"loss": 0.1739,
"mean_token_accuracy": 0.9553947448730469,
"num_tokens": 8752149.0,
"step": 316
},
{
"epoch": 4.012658227848101,
"grad_norm": 0.2620762288570404,
"learning_rate": 2.0271028929386738e-05,
"loss": 0.1409,
"mean_token_accuracy": 0.9631852507591248,
"num_tokens": 8786873.0,
"step": 317
},
{
"epoch": 4.025316455696203,
"grad_norm": 0.27156445384025574,
"learning_rate": 1.977861081999931e-05,
"loss": 0.1425,
"mean_token_accuracy": 0.9618934392929077,
"num_tokens": 8813914.0,
"step": 318
},
{
"epoch": 4.037974683544304,
"grad_norm": 0.2684096693992615,
"learning_rate": 1.92915901769281e-05,
"loss": 0.1517,
"mean_token_accuracy": 0.9602447748184204,
"num_tokens": 8843232.0,
"step": 319
},
{
"epoch": 4.050632911392405,
"grad_norm": 0.26625022292137146,
"learning_rate": 1.880999976796164e-05,
"loss": 0.1452,
"mean_token_accuracy": 0.9612977504730225,
"num_tokens": 8872054.0,
"step": 320
},
{
"epoch": 4.063291139240507,
"grad_norm": 0.24873296916484833,
"learning_rate": 1.8333871995530726e-05,
"loss": 0.1326,
"mean_token_accuracy": 0.9649026989936829,
"num_tokens": 8901408.0,
"step": 321
},
{
"epoch": 4.075949367088608,
"grad_norm": 0.3573494851589203,
"learning_rate": 1.786323889452828e-05,
"loss": 0.1975,
"mean_token_accuracy": 0.951496958732605,
"num_tokens": 8925120.0,
"step": 322
},
{
"epoch": 4.0886075949367084,
"grad_norm": 0.26980891823768616,
"learning_rate": 1.739813213015401e-05,
"loss": 0.1516,
"mean_token_accuracy": 0.9608834385871887,
"num_tokens": 8954072.0,
"step": 323
},
{
"epoch": 4.10126582278481,
"grad_norm": 0.3037337362766266,
"learning_rate": 1.693858299578396e-05,
"loss": 0.1492,
"mean_token_accuracy": 0.9619460105895996,
"num_tokens": 8979521.0,
"step": 324
},
{
"epoch": 4.113924050632911,
"grad_norm": 0.3206160068511963,
"learning_rate": 1.6484622410864835e-05,
"loss": 0.1544,
"mean_token_accuracy": 0.9592971205711365,
"num_tokens": 9009804.0,
"step": 325
},
{
"epoch": 4.1265822784810124,
"grad_norm": 0.3352915942668915,
"learning_rate": 1.6036280918833924e-05,
"loss": 0.1324,
"mean_token_accuracy": 0.9634490609169006,
"num_tokens": 9039963.0,
"step": 326
},
{
"epoch": 4.139240506329114,
"grad_norm": 0.33604586124420166,
"learning_rate": 1.5593588685063896e-05,
"loss": 0.1455,
"mean_token_accuracy": 0.9627248644828796,
"num_tokens": 9068491.0,
"step": 327
},
{
"epoch": 4.151898734177215,
"grad_norm": 0.3599500060081482,
"learning_rate": 1.515657549483328e-05,
"loss": 0.1462,
"mean_token_accuracy": 0.9611698985099792,
"num_tokens": 9096729.0,
"step": 328
},
{
"epoch": 4.1645569620253164,
"grad_norm": 0.33143875002861023,
"learning_rate": 1.4725270751322452e-05,
"loss": 0.1526,
"mean_token_accuracy": 0.959871232509613,
"num_tokens": 9125376.0,
"step": 329
},
{
"epoch": 4.177215189873418,
"grad_norm": 0.3701411187648773,
"learning_rate": 1.4299703473635218e-05,
"loss": 0.1343,
"mean_token_accuracy": 0.9638819694519043,
"num_tokens": 9149943.0,
"step": 330
},
{
"epoch": 4.189873417721519,
"grad_norm": 0.35997846722602844,
"learning_rate": 1.3879902294846536e-05,
"loss": 0.1559,
"mean_token_accuracy": 0.9590244293212891,
"num_tokens": 9175510.0,
"step": 331
},
{
"epoch": 4.2025316455696204,
"grad_norm": 0.35657989978790283,
"learning_rate": 1.3465895460075873e-05,
"loss": 0.1433,
"mean_token_accuracy": 0.9618638753890991,
"num_tokens": 9200511.0,
"step": 332
},
{
"epoch": 4.215189873417722,
"grad_norm": 0.3306591808795929,
"learning_rate": 1.3057710824586899e-05,
"loss": 0.1364,
"mean_token_accuracy": 0.9646348357200623,
"num_tokens": 9228399.0,
"step": 333
},
{
"epoch": 4.227848101265823,
"grad_norm": 0.39021170139312744,
"learning_rate": 1.2655375851913232e-05,
"loss": 0.1356,
"mean_token_accuracy": 0.9625832438468933,
"num_tokens": 9255483.0,
"step": 334
},
{
"epoch": 4.2405063291139244,
"grad_norm": 0.31789690256118774,
"learning_rate": 1.22589176120107e-05,
"loss": 0.1491,
"mean_token_accuracy": 0.9607197642326355,
"num_tokens": 9288668.0,
"step": 335
},
{
"epoch": 4.253164556962025,
"grad_norm": 0.28493577241897583,
"learning_rate": 1.186836277943606e-05,
"loss": 0.1353,
"mean_token_accuracy": 0.963397204875946,
"num_tokens": 9320205.0,
"step": 336
},
{
"epoch": 4.265822784810126,
"grad_norm": 0.2949843406677246,
"learning_rate": 1.1483737631552161e-05,
"loss": 0.1485,
"mean_token_accuracy": 0.9607917070388794,
"num_tokens": 9354726.0,
"step": 337
},
{
"epoch": 4.2784810126582276,
"grad_norm": 0.3261242210865021,
"learning_rate": 1.1105068046760048e-05,
"loss": 0.1534,
"mean_token_accuracy": 0.9607728719711304,
"num_tokens": 9378753.0,
"step": 338
},
{
"epoch": 4.291139240506329,
"grad_norm": 0.3109029531478882,
"learning_rate": 1.0732379502757717e-05,
"loss": 0.1334,
"mean_token_accuracy": 0.9623681902885437,
"num_tokens": 9405656.0,
"step": 339
},
{
"epoch": 4.30379746835443,
"grad_norm": 0.33837878704071045,
"learning_rate": 1.036569707482602e-05,
"loss": 0.125,
"mean_token_accuracy": 0.9672681093215942,
"num_tokens": 9433155.0,
"step": 340
},
{
"epoch": 4.3164556962025316,
"grad_norm": 0.3010624349117279,
"learning_rate": 1.0005045434141502e-05,
"loss": 0.1454,
"mean_token_accuracy": 0.9592652916908264,
"num_tokens": 9456467.0,
"step": 341
},
{
"epoch": 4.329113924050633,
"grad_norm": 0.26326826214790344,
"learning_rate": 9.6504488461164e-06,
"loss": 0.1089,
"mean_token_accuracy": 0.9692077040672302,
"num_tokens": 9487188.0,
"step": 342
},
{
"epoch": 4.341772151898734,
"grad_norm": 0.2840709686279297,
"learning_rate": 9.301931168766164e-06,
"loss": 0.1433,
"mean_token_accuracy": 0.9612064957618713,
"num_tokens": 9517721.0,
"step": 343
},
{
"epoch": 4.3544303797468356,
"grad_norm": 0.3117605149745941,
"learning_rate": 8.959515851104117e-06,
"loss": 0.1452,
"mean_token_accuracy": 0.9629843235015869,
"num_tokens": 9545530.0,
"step": 344
},
{
"epoch": 4.367088607594937,
"grad_norm": 0.2651097774505615,
"learning_rate": 8.623225931563805e-06,
"loss": 0.1381,
"mean_token_accuracy": 0.9643408060073853,
"num_tokens": 9576722.0,
"step": 345
},
{
"epoch": 4.379746835443038,
"grad_norm": 0.326434850692749,
"learning_rate": 8.293084036448895e-06,
"loss": 0.146,
"mean_token_accuracy": 0.9589329957962036,
"num_tokens": 9600479.0,
"step": 346
},
{
"epoch": 4.3924050632911396,
"grad_norm": 0.28717437386512756,
"learning_rate": 7.96911237841088e-06,
"loss": 0.132,
"mean_token_accuracy": 0.9652442932128906,
"num_tokens": 9629977.0,
"step": 347
},
{
"epoch": 4.405063291139241,
"grad_norm": 0.2908034026622772,
"learning_rate": 7.651332754954477e-06,
"loss": 0.1255,
"mean_token_accuracy": 0.967119038105011,
"num_tokens": 9652516.0,
"step": 348
},
{
"epoch": 4.417721518987342,
"grad_norm": 0.3260648846626282,
"learning_rate": 7.3397665469711495e-06,
"loss": 0.1597,
"mean_token_accuracy": 0.9586137533187866,
"num_tokens": 9681406.0,
"step": 349
},
{
"epoch": 4.430379746835443,
"grad_norm": 0.28147315979003906,
"learning_rate": 7.034434717300509e-06,
"loss": 0.1258,
"mean_token_accuracy": 0.9659237861633301,
"num_tokens": 9711667.0,
"step": 350
},
{
"epoch": 4.443037974683544,
"grad_norm": 0.35376855731010437,
"learning_rate": 6.735357809319809e-06,
"loss": 0.1474,
"mean_token_accuracy": 0.9578174948692322,
"num_tokens": 9735722.0,
"step": 351
},
{
"epoch": 4.455696202531645,
"grad_norm": 0.3055274784564972,
"learning_rate": 6.442555945561901e-06,
"loss": 0.1412,
"mean_token_accuracy": 0.9630998969078064,
"num_tokens": 9766897.0,
"step": 352
},
{
"epoch": 4.468354430379747,
"grad_norm": 0.29014500975608826,
"learning_rate": 6.156048826361238e-06,
"loss": 0.1395,
"mean_token_accuracy": 0.9621520042419434,
"num_tokens": 9796738.0,
"step": 353
},
{
"epoch": 4.481012658227848,
"grad_norm": 0.2847389280796051,
"learning_rate": 5.8758557285284125e-06,
"loss": 0.1216,
"mean_token_accuracy": 0.9675486087799072,
"num_tokens": 9831007.0,
"step": 354
},
{
"epoch": 4.493670886075949,
"grad_norm": 0.37046611309051514,
"learning_rate": 5.6019955040531925e-06,
"loss": 0.1555,
"mean_token_accuracy": 0.958193838596344,
"num_tokens": 9854369.0,
"step": 355
},
{
"epoch": 4.506329113924051,
"grad_norm": 0.30166560411453247,
"learning_rate": 5.334486578836118e-06,
"loss": 0.1436,
"mean_token_accuracy": 0.9620810151100159,
"num_tokens": 9881016.0,
"step": 356
},
{
"epoch": 4.518987341772152,
"grad_norm": 0.3337922990322113,
"learning_rate": 5.073346951448699e-06,
"loss": 0.1313,
"mean_token_accuracy": 0.9661489129066467,
"num_tokens": 9905481.0,
"step": 357
},
{
"epoch": 4.531645569620253,
"grad_norm": 0.2855200469493866,
"learning_rate": 4.818594191922576e-06,
"loss": 0.1381,
"mean_token_accuracy": 0.9621705412864685,
"num_tokens": 9933962.0,
"step": 358
},
{
"epoch": 4.544303797468355,
"grad_norm": 0.2855769395828247,
"learning_rate": 4.5702454405672e-06,
"loss": 0.1284,
"mean_token_accuracy": 0.9656704068183899,
"num_tokens": 9962398.0,
"step": 359
},
{
"epoch": 4.556962025316456,
"grad_norm": 0.3019951283931732,
"learning_rate": 4.328317406816751e-06,
"loss": 0.1282,
"mean_token_accuracy": 0.9652332067489624,
"num_tokens": 9988809.0,
"step": 360
},
{
"epoch": 4.569620253164557,
"grad_norm": 0.336088627576828,
"learning_rate": 4.092826368105795e-06,
"loss": 0.1556,
"mean_token_accuracy": 0.9580214023590088,
"num_tokens": 10013052.0,
"step": 361
},
{
"epoch": 4.582278481012658,
"grad_norm": 0.31958091259002686,
"learning_rate": 3.863788168774118e-06,
"loss": 0.1728,
"mean_token_accuracy": 0.9531184434890747,
"num_tokens": 10044173.0,
"step": 362
},
{
"epoch": 4.594936708860759,
"grad_norm": 0.3252604603767395,
"learning_rate": 3.6412182190007082e-06,
"loss": 0.1478,
"mean_token_accuracy": 0.9624072909355164,
"num_tokens": 10073897.0,
"step": 363
},
{
"epoch": 4.6075949367088604,
"grad_norm": 0.42186495661735535,
"learning_rate": 3.425131493766931e-06,
"loss": 0.1508,
"mean_token_accuracy": 0.9569892287254333,
"num_tokens": 10093398.0,
"step": 364
},
{
"epoch": 4.620253164556962,
"grad_norm": 0.3029695451259613,
"learning_rate": 3.2155425318489584e-06,
"loss": 0.13,
"mean_token_accuracy": 0.9656196236610413,
"num_tokens": 10121414.0,
"step": 365
},
{
"epoch": 4.632911392405063,
"grad_norm": 0.32184407114982605,
"learning_rate": 3.012465434839529e-06,
"loss": 0.1449,
"mean_token_accuracy": 0.9606809616088867,
"num_tokens": 10146148.0,
"step": 366
},
{
"epoch": 4.6455696202531644,
"grad_norm": 0.36808857321739197,
"learning_rate": 2.8159138661992824e-06,
"loss": 0.143,
"mean_token_accuracy": 0.9619269967079163,
"num_tokens": 10172346.0,
"step": 367
},
{
"epoch": 4.658227848101266,
"grad_norm": 0.3044672906398773,
"learning_rate": 2.6259010503373206e-06,
"loss": 0.129,
"mean_token_accuracy": 0.9652129411697388,
"num_tokens": 10199949.0,
"step": 368
},
{
"epoch": 4.670886075949367,
"grad_norm": 0.3074134886264801,
"learning_rate": 2.4424397717215387e-06,
"loss": 0.1343,
"mean_token_accuracy": 0.9630903005599976,
"num_tokens": 10227648.0,
"step": 369
},
{
"epoch": 4.6835443037974684,
"grad_norm": 0.2984522581100464,
"learning_rate": 2.2655423740183924e-06,
"loss": 0.1369,
"mean_token_accuracy": 0.9643847346305847,
"num_tokens": 10257643.0,
"step": 370
},
{
"epoch": 4.69620253164557,
"grad_norm": 0.2795273959636688,
"learning_rate": 2.0952207592624505e-06,
"loss": 0.1318,
"mean_token_accuracy": 0.9641938805580139,
"num_tokens": 10289601.0,
"step": 371
},
{
"epoch": 4.708860759493671,
"grad_norm": 0.31014949083328247,
"learning_rate": 1.9314863870555255e-06,
"loss": 0.1436,
"mean_token_accuracy": 0.9634020924568176,
"num_tokens": 10315978.0,
"step": 372
},
{
"epoch": 4.7215189873417724,
"grad_norm": 0.32286179065704346,
"learning_rate": 1.7743502737957106e-06,
"loss": 0.1496,
"mean_token_accuracy": 0.9591047167778015,
"num_tokens": 10339052.0,
"step": 373
},
{
"epoch": 4.734177215189874,
"grad_norm": 0.3142798840999603,
"learning_rate": 1.6238229919361858e-06,
"loss": 0.1329,
"mean_token_accuracy": 0.9642317295074463,
"num_tokens": 10364921.0,
"step": 374
},
{
"epoch": 4.746835443037975,
"grad_norm": 0.3594357669353485,
"learning_rate": 1.4799146692737741e-06,
"loss": 0.1779,
"mean_token_accuracy": 0.9541767835617065,
"num_tokens": 10389274.0,
"step": 375
},
{
"epoch": 4.759493670886076,
"grad_norm": 0.3242360055446625,
"learning_rate": 1.3426349882676325e-06,
"loss": 0.144,
"mean_token_accuracy": 0.9641324877738953,
"num_tokens": 10422432.0,
"step": 376
},
{
"epoch": 4.772151898734177,
"grad_norm": 0.2857370972633362,
"learning_rate": 1.211993185387772e-06,
"loss": 0.1383,
"mean_token_accuracy": 0.9639822840690613,
"num_tokens": 10450510.0,
"step": 377
},
{
"epoch": 4.784810126582278,
"grad_norm": 0.2964177131652832,
"learning_rate": 1.0879980504935772e-06,
"loss": 0.1262,
"mean_token_accuracy": 0.9655276536941528,
"num_tokens": 10480337.0,
"step": 378
},
{
"epoch": 4.7974683544303796,
"grad_norm": 0.29852089285850525,
"learning_rate": 9.706579262424131e-07,
"loss": 0.1481,
"mean_token_accuracy": 0.9615073204040527,
"num_tokens": 10512485.0,
"step": 379
},
{
"epoch": 4.810126582278481,
"grad_norm": 0.36380690336227417,
"learning_rate": 8.599807075283406e-07,
"loss": 0.1617,
"mean_token_accuracy": 0.9566697478294373,
"num_tokens": 10534289.0,
"step": 380
},
{
"epoch": 4.822784810126582,
"grad_norm": 0.3195270895957947,
"learning_rate": 7.559738409508855e-07,
"loss": 0.1423,
"mean_token_accuracy": 0.960354745388031,
"num_tokens": 10559047.0,
"step": 381
},
{
"epoch": 4.8354430379746836,
"grad_norm": 0.3309272229671478,
"learning_rate": 6.586443243140838e-07,
"loss": 0.142,
"mean_token_accuracy": 0.9632369875907898,
"num_tokens": 10584789.0,
"step": 382
},
{
"epoch": 4.848101265822785,
"grad_norm": 0.33980849385261536,
"learning_rate": 5.679987061555703e-07,
"loss": 0.1221,
"mean_token_accuracy": 0.9658645391464233,
"num_tokens": 10612156.0,
"step": 383
},
{
"epoch": 4.860759493670886,
"grad_norm": 0.3266946077346802,
"learning_rate": 4.840430853060518e-07,
"loss": 0.1485,
"mean_token_accuracy": 0.9566022753715515,
"num_tokens": 10634894.0,
"step": 384
},
{
"epoch": 4.8734177215189876,
"grad_norm": 0.2987641394138336,
"learning_rate": 4.0678311047890327e-07,
"loss": 0.1335,
"mean_token_accuracy": 0.9644708633422852,
"num_tokens": 10664089.0,
"step": 385
},
{
"epoch": 4.886075949367089,
"grad_norm": 0.29495102167129517,
"learning_rate": 3.362239798901712e-07,
"loss": 0.1362,
"mean_token_accuracy": 0.9644386768341064,
"num_tokens": 10689602.0,
"step": 386
},
{
"epoch": 4.89873417721519,
"grad_norm": 0.3115140497684479,
"learning_rate": 2.723704409087979e-07,
"loss": 0.1494,
"mean_token_accuracy": 0.9600952863693237,
"num_tokens": 10720314.0,
"step": 387
},
{
"epoch": 4.911392405063291,
"grad_norm": 0.30226320028305054,
"learning_rate": 2.1522678973718847e-07,
"loss": 0.1272,
"mean_token_accuracy": 0.9658134579658508,
"num_tokens": 10748898.0,
"step": 388
},
{
"epoch": 4.924050632911392,
"grad_norm": 0.31414154171943665,
"learning_rate": 1.6479687112217479e-07,
"loss": 0.1447,
"mean_token_accuracy": 0.9592844247817993,
"num_tokens": 10778533.0,
"step": 389
},
{
"epoch": 4.936708860759493,
"grad_norm": 0.2912035584449768,
"learning_rate": 1.2108407809635624e-07,
"loss": 0.1309,
"mean_token_accuracy": 0.9652738571166992,
"num_tokens": 10805090.0,
"step": 390
},
{
"epoch": 4.949367088607595,
"grad_norm": 0.2709757685661316,
"learning_rate": 8.40913517497377e-08,
"loss": 0.1277,
"mean_token_accuracy": 0.96564781665802,
"num_tokens": 10834730.0,
"step": 391
},
{
"epoch": 4.962025316455696,
"grad_norm": 0.3017437756061554,
"learning_rate": 5.382118103193223e-08,
"loss": 0.1397,
"mean_token_accuracy": 0.9620010256767273,
"num_tokens": 10862400.0,
"step": 392
},
{
"epoch": 4.974683544303797,
"grad_norm": 0.37488335371017456,
"learning_rate": 3.027560258465067e-08,
"loss": 0.1487,
"mean_token_accuracy": 0.9623703956604004,
"num_tokens": 10884840.0,
"step": 393
},
{
"epoch": 4.987341772151899,
"grad_norm": 0.2931729853153229,
"learning_rate": 1.345620060465569e-08,
"loss": 0.1334,
"mean_token_accuracy": 0.9638663530349731,
"num_tokens": 10915734.0,
"step": 394
},
{
"epoch": 5.0,
"grad_norm": 0.24923710525035858,
"learning_rate": 3.3641067372358612e-09,
"loss": 0.1168,
"mean_token_accuracy": 0.9699816107749939,
"num_tokens": 10947845.0,
"step": 395
},
{
"epoch": 5.0,
"step": 395,
"total_flos": 1.1838649578050028e+18,
"train_loss": 0.32972808646250373,
"train_runtime": 2337.3269,
"train_samples_per_second": 10.696,
"train_steps_per_second": 0.169
}
],
"logging_steps": 1.0,
"max_steps": 395,
"num_input_tokens_seen": 0,
"num_train_epochs": 5,
"save_steps": 100,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": true
},
"attributes": {}
}
},
"total_flos": 1.1838649578050028e+18,
"train_batch_size": 16,
"trial_name": null,
"trial_params": null
}