YeMoKoo's picture
Add final checkpoint: trace_upstream_pre_order5
e7453db verified
Raw
History Blame Contribute Delete
60.9 kB
{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 3.0,
"eval_steps": 500,
"global_step": 237,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.012658227848101266,
"grad_norm": 3.3755528926849365,
"learning_rate": 0.0,
"loss": 1.5248,
"mean_token_accuracy": 0.6810985803604126,
"num_tokens": 20782.0,
"step": 1
},
{
"epoch": 0.02531645569620253,
"grad_norm": 3.3469796180725098,
"learning_rate": 2.5e-05,
"loss": 1.5007,
"mean_token_accuracy": 0.684084951877594,
"num_tokens": 41801.0,
"step": 2
},
{
"epoch": 0.0379746835443038,
"grad_norm": 1.97304368019104,
"learning_rate": 5e-05,
"loss": 1.4012,
"mean_token_accuracy": 0.6956851482391357,
"num_tokens": 62978.0,
"step": 3
},
{
"epoch": 0.05063291139240506,
"grad_norm": 1.4511849880218506,
"learning_rate": 7.500000000000001e-05,
"loss": 1.2029,
"mean_token_accuracy": 0.7223535776138306,
"num_tokens": 85034.0,
"step": 4
},
{
"epoch": 0.06329113924050633,
"grad_norm": 0.8851504921913147,
"learning_rate": 0.0001,
"loss": 1.0773,
"mean_token_accuracy": 0.7364060282707214,
"num_tokens": 107185.0,
"step": 5
},
{
"epoch": 0.0759493670886076,
"grad_norm": 0.7546831965446472,
"learning_rate": 0.000125,
"loss": 0.9672,
"mean_token_accuracy": 0.758962869644165,
"num_tokens": 127806.0,
"step": 6
},
{
"epoch": 0.08860759493670886,
"grad_norm": 1.457136869430542,
"learning_rate": 0.00015000000000000001,
"loss": 0.8743,
"mean_token_accuracy": 0.7788419127464294,
"num_tokens": 148231.0,
"step": 7
},
{
"epoch": 0.10126582278481013,
"grad_norm": 1.194122076034546,
"learning_rate": 0.000175,
"loss": 0.7579,
"mean_token_accuracy": 0.8078464269638062,
"num_tokens": 169757.0,
"step": 8
},
{
"epoch": 0.11392405063291139,
"grad_norm": 0.7309107184410095,
"learning_rate": 0.0002,
"loss": 0.6593,
"mean_token_accuracy": 0.8331207633018494,
"num_tokens": 190207.0,
"step": 9
},
{
"epoch": 0.12658227848101267,
"grad_norm": 0.7755345106124878,
"learning_rate": 0.00019999058994907564,
"loss": 0.5264,
"mean_token_accuracy": 0.8658320307731628,
"num_tokens": 209441.0,
"step": 10
},
{
"epoch": 0.13924050632911392,
"grad_norm": 0.6617028117179871,
"learning_rate": 0.0001999623615672837,
"loss": 0.5016,
"mean_token_accuracy": 0.8747288584709167,
"num_tokens": 229789.0,
"step": 11
},
{
"epoch": 0.1518987341772152,
"grad_norm": 0.5665917992591858,
"learning_rate": 0.00019991532016723439,
"loss": 0.4617,
"mean_token_accuracy": 0.8841381072998047,
"num_tokens": 250645.0,
"step": 12
},
{
"epoch": 0.16455696202531644,
"grad_norm": 0.47884827852249146,
"learning_rate": 0.00019984947460216707,
"loss": 0.4011,
"mean_token_accuracy": 0.8991096615791321,
"num_tokens": 271375.0,
"step": 13
},
{
"epoch": 0.17721518987341772,
"grad_norm": 0.440388947725296,
"learning_rate": 0.00019976483726428422,
"loss": 0.3918,
"mean_token_accuracy": 0.9046533703804016,
"num_tokens": 292499.0,
"step": 14
},
{
"epoch": 0.189873417721519,
"grad_norm": 0.5122181177139282,
"learning_rate": 0.00019966142408241901,
"loss": 0.4464,
"mean_token_accuracy": 0.8897697329521179,
"num_tokens": 313755.0,
"step": 15
},
{
"epoch": 0.20253164556962025,
"grad_norm": 0.41976478695869446,
"learning_rate": 0.00019953925451903756,
"loss": 0.3145,
"mean_token_accuracy": 0.9217761158943176,
"num_tokens": 335462.0,
"step": 16
},
{
"epoch": 0.21518987341772153,
"grad_norm": 0.4809647798538208,
"learning_rate": 0.00019939835156657616,
"loss": 0.372,
"mean_token_accuracy": 0.9070643186569214,
"num_tokens": 355712.0,
"step": 17
},
{
"epoch": 0.22784810126582278,
"grad_norm": 0.44067713618278503,
"learning_rate": 0.00019923874174311394,
"loss": 0.308,
"mean_token_accuracy": 0.9210803508758545,
"num_tokens": 376658.0,
"step": 18
},
{
"epoch": 0.24050632911392406,
"grad_norm": 0.3857305645942688,
"learning_rate": 0.00019906045508738228,
"loss": 0.3021,
"mean_token_accuracy": 0.9239698648452759,
"num_tokens": 396622.0,
"step": 19
},
{
"epoch": 0.25316455696202533,
"grad_norm": 0.4351586699485779,
"learning_rate": 0.00019886352515311134,
"loss": 0.2879,
"mean_token_accuracy": 0.9282914400100708,
"num_tokens": 417604.0,
"step": 20
},
{
"epoch": 0.26582278481012656,
"grad_norm": 0.3039501905441284,
"learning_rate": 0.00019864798900271532,
"loss": 0.2892,
"mean_token_accuracy": 0.9262740015983582,
"num_tokens": 438312.0,
"step": 21
},
{
"epoch": 0.27848101265822783,
"grad_norm": 0.30652645230293274,
"learning_rate": 0.00019841388720031727,
"loss": 0.2586,
"mean_token_accuracy": 0.9390592575073242,
"num_tokens": 460742.0,
"step": 22
},
{
"epoch": 0.2911392405063291,
"grad_norm": 0.27710649371147156,
"learning_rate": 0.00019816126380411476,
"loss": 0.2507,
"mean_token_accuracy": 0.9424484968185425,
"num_tokens": 481292.0,
"step": 23
},
{
"epoch": 0.3037974683544304,
"grad_norm": 0.31043171882629395,
"learning_rate": 0.00019789016635808837,
"loss": 0.244,
"mean_token_accuracy": 0.9382171034812927,
"num_tokens": 502883.0,
"step": 24
},
{
"epoch": 0.31645569620253167,
"grad_norm": 0.26763108372688293,
"learning_rate": 0.00019760064588305345,
"loss": 0.2112,
"mean_token_accuracy": 0.9468953013420105,
"num_tokens": 524527.0,
"step": 25
},
{
"epoch": 0.3291139240506329,
"grad_norm": 0.271287202835083,
"learning_rate": 0.0001972927568670583,
"loss": 0.2468,
"mean_token_accuracy": 0.9391064643859863,
"num_tokens": 543460.0,
"step": 26
},
{
"epoch": 0.34177215189873417,
"grad_norm": 0.20461638271808624,
"learning_rate": 0.00019696655725512933,
"loss": 0.194,
"mean_token_accuracy": 0.9515607357025146,
"num_tokens": 568256.0,
"step": 27
},
{
"epoch": 0.35443037974683544,
"grad_norm": 0.268459290266037,
"learning_rate": 0.00019662210843836574,
"loss": 0.2181,
"mean_token_accuracy": 0.9476127624511719,
"num_tokens": 590291.0,
"step": 28
},
{
"epoch": 0.3670886075949367,
"grad_norm": 0.3005685806274414,
"learning_rate": 0.00019625947524238563,
"loss": 0.2215,
"mean_token_accuracy": 0.9442426562309265,
"num_tokens": 613204.0,
"step": 29
},
{
"epoch": 0.379746835443038,
"grad_norm": 0.22735565900802612,
"learning_rate": 0.0001958787259151258,
"loss": 0.211,
"mean_token_accuracy": 0.9458523392677307,
"num_tokens": 634063.0,
"step": 30
},
{
"epoch": 0.3924050632911392,
"grad_norm": 0.2072056382894516,
"learning_rate": 0.0001954799321139975,
"loss": 0.2294,
"mean_token_accuracy": 0.9439746141433716,
"num_tokens": 654939.0,
"step": 31
},
{
"epoch": 0.4050632911392405,
"grad_norm": 0.24833987653255463,
"learning_rate": 0.00019506316889240027,
"loss": 0.2311,
"mean_token_accuracy": 0.9401175379753113,
"num_tokens": 676779.0,
"step": 32
},
{
"epoch": 0.4177215189873418,
"grad_norm": 0.21333575248718262,
"learning_rate": 0.0001946285146855968,
"loss": 0.2074,
"mean_token_accuracy": 0.9479069113731384,
"num_tokens": 698151.0,
"step": 33
},
{
"epoch": 0.43037974683544306,
"grad_norm": 0.28180328011512756,
"learning_rate": 0.00019417605129595157,
"loss": 0.2039,
"mean_token_accuracy": 0.9491313099861145,
"num_tokens": 718994.0,
"step": 34
},
{
"epoch": 0.4430379746835443,
"grad_norm": 0.20438188314437866,
"learning_rate": 0.0001937058638775353,
"loss": 0.1828,
"mean_token_accuracy": 0.9527903199195862,
"num_tokens": 740812.0,
"step": 35
},
{
"epoch": 0.45569620253164556,
"grad_norm": 0.1980065107345581,
"learning_rate": 0.00019321804092009906,
"loss": 0.2165,
"mean_token_accuracy": 0.9470421671867371,
"num_tokens": 761685.0,
"step": 36
},
{
"epoch": 0.46835443037974683,
"grad_norm": 0.21566878259181976,
"learning_rate": 0.00019271267423242024,
"loss": 0.2252,
"mean_token_accuracy": 0.943629801273346,
"num_tokens": 783640.0,
"step": 37
},
{
"epoch": 0.4810126582278481,
"grad_norm": 0.2180386781692505,
"learning_rate": 0.0001921898589250242,
"loss": 0.2315,
"mean_token_accuracy": 0.9406498670578003,
"num_tokens": 803923.0,
"step": 38
},
{
"epoch": 0.4936708860759494,
"grad_norm": 0.18960478901863098,
"learning_rate": 0.00019164969339228422,
"loss": 0.1903,
"mean_token_accuracy": 0.9512442350387573,
"num_tokens": 824723.0,
"step": 39
},
{
"epoch": 0.5063291139240507,
"grad_norm": 0.24511095881462097,
"learning_rate": 0.00019109227929390378,
"loss": 0.2529,
"mean_token_accuracy": 0.9372138381004333,
"num_tokens": 845317.0,
"step": 40
},
{
"epoch": 0.5189873417721519,
"grad_norm": 0.1957797110080719,
"learning_rate": 0.00019051772153578389,
"loss": 0.1883,
"mean_token_accuracy": 0.9512593746185303,
"num_tokens": 867416.0,
"step": 41
},
{
"epoch": 0.5316455696202531,
"grad_norm": 0.2206275761127472,
"learning_rate": 0.00018992612825027976,
"loss": 0.2162,
"mean_token_accuracy": 0.9448105692863464,
"num_tokens": 886904.0,
"step": 42
},
{
"epoch": 0.5443037974683544,
"grad_norm": 0.19612912833690643,
"learning_rate": 0.00018931761077585035,
"loss": 0.1981,
"mean_token_accuracy": 0.9489004611968994,
"num_tokens": 908886.0,
"step": 43
},
{
"epoch": 0.5569620253164557,
"grad_norm": 0.22512373328208923,
"learning_rate": 0.00018869228363610404,
"loss": 0.2256,
"mean_token_accuracy": 0.9439067840576172,
"num_tokens": 929202.0,
"step": 44
},
{
"epoch": 0.569620253164557,
"grad_norm": 0.2119680941104889,
"learning_rate": 0.00018805026451824546,
"loss": 0.1845,
"mean_token_accuracy": 0.9552789926528931,
"num_tokens": 949033.0,
"step": 45
},
{
"epoch": 0.5822784810126582,
"grad_norm": 0.1732683926820755,
"learning_rate": 0.00018739167425092644,
"loss": 0.1919,
"mean_token_accuracy": 0.9519040584564209,
"num_tokens": 971365.0,
"step": 46
},
{
"epoch": 0.5949367088607594,
"grad_norm": 0.18628673255443573,
"learning_rate": 0.00018671663678150607,
"loss": 0.1985,
"mean_token_accuracy": 0.9494044780731201,
"num_tokens": 990739.0,
"step": 47
},
{
"epoch": 0.6075949367088608,
"grad_norm": 0.2027333527803421,
"learning_rate": 0.0001860252791527236,
"loss": 0.229,
"mean_token_accuracy": 0.9417348504066467,
"num_tokens": 1011450.0,
"step": 48
},
{
"epoch": 0.620253164556962,
"grad_norm": 0.17826716601848602,
"learning_rate": 0.00018531773147878895,
"loss": 0.2044,
"mean_token_accuracy": 0.9504271149635315,
"num_tokens": 1031182.0,
"step": 49
},
{
"epoch": 0.6329113924050633,
"grad_norm": 0.18673086166381836,
"learning_rate": 0.00018459412692089494,
"loss": 0.1769,
"mean_token_accuracy": 0.9546067118644714,
"num_tokens": 1054994.0,
"step": 50
},
{
"epoch": 0.6455696202531646,
"grad_norm": 0.18725241720676422,
"learning_rate": 0.00018385460166215638,
"loss": 0.1853,
"mean_token_accuracy": 0.9533385038375854,
"num_tokens": 1075696.0,
"step": 51
},
{
"epoch": 0.6582278481012658,
"grad_norm": 0.23499581217765808,
"learning_rate": 0.00018309929488198012,
"loss": 0.222,
"mean_token_accuracy": 0.944871187210083,
"num_tokens": 1098543.0,
"step": 52
},
{
"epoch": 0.6708860759493671,
"grad_norm": 0.20952437818050385,
"learning_rate": 0.00018232834872987147,
"loss": 0.163,
"mean_token_accuracy": 0.9581373333930969,
"num_tokens": 1119652.0,
"step": 53
},
{
"epoch": 0.6835443037974683,
"grad_norm": 0.342645525932312,
"learning_rate": 0.0001815419082986815,
"loss": 0.2146,
"mean_token_accuracy": 0.948540985584259,
"num_tokens": 1141306.0,
"step": 54
},
{
"epoch": 0.6962025316455697,
"grad_norm": 0.18588639795780182,
"learning_rate": 0.00018074012159730032,
"loss": 0.1858,
"mean_token_accuracy": 0.9529316425323486,
"num_tokens": 1161171.0,
"step": 55
},
{
"epoch": 0.7088607594936709,
"grad_norm": 0.18335570394992828,
"learning_rate": 0.00017992313952280172,
"loss": 0.1939,
"mean_token_accuracy": 0.950637936592102,
"num_tokens": 1181534.0,
"step": 56
},
{
"epoch": 0.7215189873417721,
"grad_norm": 0.1759781688451767,
"learning_rate": 0.00017909111583204422,
"loss": 0.1681,
"mean_token_accuracy": 0.9576790928840637,
"num_tokens": 1201659.0,
"step": 57
},
{
"epoch": 0.7341772151898734,
"grad_norm": 0.1828421950340271,
"learning_rate": 0.0001782442071127338,
"loss": 0.2227,
"mean_token_accuracy": 0.9445362091064453,
"num_tokens": 1222313.0,
"step": 58
},
{
"epoch": 0.7468354430379747,
"grad_norm": 0.20731791853904724,
"learning_rate": 0.00017738257275395404,
"loss": 0.1615,
"mean_token_accuracy": 0.9587121605873108,
"num_tokens": 1242286.0,
"step": 59
},
{
"epoch": 0.759493670886076,
"grad_norm": 0.1657421737909317,
"learning_rate": 0.0001765063749161688,
"loss": 0.1769,
"mean_token_accuracy": 0.9534204006195068,
"num_tokens": 1262874.0,
"step": 60
},
{
"epoch": 0.7721518987341772,
"grad_norm": 0.17372827231884003,
"learning_rate": 0.00017561577850070355,
"loss": 0.1975,
"mean_token_accuracy": 0.9501790404319763,
"num_tokens": 1282769.0,
"step": 61
},
{
"epoch": 0.7848101265822784,
"grad_norm": 0.2345019429922104,
"learning_rate": 0.00017471095111871074,
"loss": 0.2136,
"mean_token_accuracy": 0.9452736377716064,
"num_tokens": 1304139.0,
"step": 62
},
{
"epoch": 0.7974683544303798,
"grad_norm": 0.18278631567955017,
"learning_rate": 0.00017379206305962526,
"loss": 0.2205,
"mean_token_accuracy": 0.9442360997200012,
"num_tokens": 1324467.0,
"step": 63
},
{
"epoch": 0.810126582278481,
"grad_norm": 0.19478175044059753,
"learning_rate": 0.00017285928725911562,
"loss": 0.1677,
"mean_token_accuracy": 0.957406759262085,
"num_tokens": 1345262.0,
"step": 64
},
{
"epoch": 0.8227848101265823,
"grad_norm": 0.16885536909103394,
"learning_rate": 0.00017191279926653761,
"loss": 0.1859,
"mean_token_accuracy": 0.9530674815177917,
"num_tokens": 1368700.0,
"step": 65
},
{
"epoch": 0.8354430379746836,
"grad_norm": 0.20440581440925598,
"learning_rate": 0.00017095277721189528,
"loss": 0.1805,
"mean_token_accuracy": 0.9521450400352478,
"num_tokens": 1388344.0,
"step": 66
},
{
"epoch": 0.8481012658227848,
"grad_norm": 0.19661499559879303,
"learning_rate": 0.00016997940177231722,
"loss": 0.1758,
"mean_token_accuracy": 0.9565622806549072,
"num_tokens": 1407723.0,
"step": 67
},
{
"epoch": 0.8607594936708861,
"grad_norm": 0.18348322808742523,
"learning_rate": 0.00016899285613805246,
"loss": 0.172,
"mean_token_accuracy": 0.9548096060752869,
"num_tokens": 1427747.0,
"step": 68
},
{
"epoch": 0.8734177215189873,
"grad_norm": 0.16349603235721588,
"learning_rate": 0.00016799332597799413,
"loss": 0.1429,
"mean_token_accuracy": 0.9632624983787537,
"num_tokens": 1446729.0,
"step": 69
},
{
"epoch": 0.8860759493670886,
"grad_norm": 0.19582310318946838,
"learning_rate": 0.0001669809994047364,
"loss": 0.1768,
"mean_token_accuracy": 0.9543310403823853,
"num_tokens": 1466084.0,
"step": 70
},
{
"epoch": 0.8987341772151899,
"grad_norm": 0.19498325884342194,
"learning_rate": 0.00016595606693917142,
"loss": 0.1891,
"mean_token_accuracy": 0.954316258430481,
"num_tokens": 1485783.0,
"step": 71
},
{
"epoch": 0.9113924050632911,
"grad_norm": 0.16052420437335968,
"learning_rate": 0.00016491872147463306,
"loss": 0.1587,
"mean_token_accuracy": 0.9606679677963257,
"num_tokens": 1505907.0,
"step": 72
},
{
"epoch": 0.9240506329113924,
"grad_norm": 0.16272246837615967,
"learning_rate": 0.00016386915824059427,
"loss": 0.1668,
"mean_token_accuracy": 0.9579792618751526,
"num_tokens": 1527389.0,
"step": 73
},
{
"epoch": 0.9367088607594937,
"grad_norm": 0.16647444665431976,
"learning_rate": 0.00016280757476592466,
"loss": 0.1536,
"mean_token_accuracy": 0.960762083530426,
"num_tokens": 1547714.0,
"step": 74
},
{
"epoch": 0.9493670886075949,
"grad_norm": 0.1784556359052658,
"learning_rate": 0.00016173417084171536,
"loss": 0.1924,
"mean_token_accuracy": 0.9510428309440613,
"num_tokens": 1567244.0,
"step": 75
},
{
"epoch": 0.9620253164556962,
"grad_norm": 0.15793780982494354,
"learning_rate": 0.0001606491484836782,
"loss": 0.1757,
"mean_token_accuracy": 0.954423725605011,
"num_tokens": 1586726.0,
"step": 76
},
{
"epoch": 0.9746835443037974,
"grad_norm": 0.1410311460494995,
"learning_rate": 0.00015955271189412598,
"loss": 0.1393,
"mean_token_accuracy": 0.9642706513404846,
"num_tokens": 1608089.0,
"step": 77
},
{
"epoch": 0.9873417721518988,
"grad_norm": 0.2086767852306366,
"learning_rate": 0.00015844506742354164,
"loss": 0.2087,
"mean_token_accuracy": 0.9479678869247437,
"num_tokens": 1629313.0,
"step": 78
},
{
"epoch": 1.0,
"grad_norm": 0.1745402216911316,
"learning_rate": 0.00015732642353174259,
"loss": 0.1402,
"mean_token_accuracy": 0.9628644585609436,
"num_tokens": 1649681.0,
"step": 79
},
{
"epoch": 1.0126582278481013,
"grad_norm": 0.14212512969970703,
"learning_rate": 0.00015619699074864864,
"loss": 0.1281,
"mean_token_accuracy": 0.9649726152420044,
"num_tokens": 1668359.0,
"step": 80
},
{
"epoch": 1.0253164556962024,
"grad_norm": 0.13101430237293243,
"learning_rate": 0.00015505698163465986,
"loss": 0.1189,
"mean_token_accuracy": 0.9688678979873657,
"num_tokens": 1689623.0,
"step": 81
},
{
"epoch": 1.0379746835443038,
"grad_norm": 0.14908701181411743,
"learning_rate": 0.00015390661074065256,
"loss": 0.1313,
"mean_token_accuracy": 0.9633692502975464,
"num_tokens": 1710380.0,
"step": 82
},
{
"epoch": 1.0506329113924051,
"grad_norm": 0.16834689676761627,
"learning_rate": 0.00015274609456760073,
"loss": 0.1236,
"mean_token_accuracy": 0.9671345949172974,
"num_tokens": 1731530.0,
"step": 83
},
{
"epoch": 1.0632911392405062,
"grad_norm": 0.1714702993631363,
"learning_rate": 0.00015157565152583002,
"loss": 0.1343,
"mean_token_accuracy": 0.9642593860626221,
"num_tokens": 1751963.0,
"step": 84
},
{
"epoch": 1.0759493670886076,
"grad_norm": 0.18395373225212097,
"learning_rate": 0.00015039550189391298,
"loss": 0.1179,
"mean_token_accuracy": 0.96883624792099,
"num_tokens": 1773398.0,
"step": 85
},
{
"epoch": 1.0886075949367089,
"grad_norm": 0.18526509404182434,
"learning_rate": 0.0001492058677772123,
"loss": 0.1327,
"mean_token_accuracy": 0.9650301337242126,
"num_tokens": 1793851.0,
"step": 86
},
{
"epoch": 1.1012658227848102,
"grad_norm": 0.1679631620645523,
"learning_rate": 0.00014800697306608044,
"loss": 0.1273,
"mean_token_accuracy": 0.9668911099433899,
"num_tokens": 1813668.0,
"step": 87
},
{
"epoch": 1.1139240506329113,
"grad_norm": 0.15644878149032593,
"learning_rate": 0.00014679904339372302,
"loss": 0.1319,
"mean_token_accuracy": 0.9673177599906921,
"num_tokens": 1834875.0,
"step": 88
},
{
"epoch": 1.1265822784810127,
"grad_norm": 0.18947693705558777,
"learning_rate": 0.0001455823060937347,
"loss": 0.1499,
"mean_token_accuracy": 0.9611180424690247,
"num_tokens": 1855797.0,
"step": 89
},
{
"epoch": 1.139240506329114,
"grad_norm": 0.15163911879062653,
"learning_rate": 0.00014435699015731448,
"loss": 0.1419,
"mean_token_accuracy": 0.9620731472969055,
"num_tokens": 1875715.0,
"step": 90
},
{
"epoch": 1.1518987341772151,
"grad_norm": 0.1474975049495697,
"learning_rate": 0.00014312332619016965,
"loss": 0.1245,
"mean_token_accuracy": 0.9681270718574524,
"num_tokens": 1895294.0,
"step": 91
},
{
"epoch": 1.1645569620253164,
"grad_norm": 0.19832119345664978,
"learning_rate": 0.00014188154636911524,
"loss": 0.1472,
"mean_token_accuracy": 0.9617631435394287,
"num_tokens": 1916411.0,
"step": 92
},
{
"epoch": 1.1772151898734178,
"grad_norm": 0.14573758840560913,
"learning_rate": 0.00014063188439837832,
"loss": 0.1152,
"mean_token_accuracy": 0.9696823954582214,
"num_tokens": 1939300.0,
"step": 93
},
{
"epoch": 1.189873417721519,
"grad_norm": 0.17945419251918793,
"learning_rate": 0.0001393745754656146,
"loss": 0.1419,
"mean_token_accuracy": 0.9620354175567627,
"num_tokens": 1960647.0,
"step": 94
},
{
"epoch": 1.2025316455696202,
"grad_norm": 0.2099403440952301,
"learning_rate": 0.00013810985619764572,
"loss": 0.1442,
"mean_token_accuracy": 0.9616883397102356,
"num_tokens": 1980470.0,
"step": 95
},
{
"epoch": 1.2151898734177216,
"grad_norm": 0.14469695091247559,
"learning_rate": 0.00013683796461592604,
"loss": 0.1152,
"mean_token_accuracy": 0.9697718620300293,
"num_tokens": 2001177.0,
"step": 96
},
{
"epoch": 1.2278481012658227,
"grad_norm": 0.1826285570859909,
"learning_rate": 0.00013555914009174663,
"loss": 0.149,
"mean_token_accuracy": 0.9613690376281738,
"num_tokens": 2021898.0,
"step": 97
},
{
"epoch": 1.240506329113924,
"grad_norm": 0.18723325431346893,
"learning_rate": 0.00013427362330118543,
"loss": 0.1543,
"mean_token_accuracy": 0.9578179121017456,
"num_tokens": 2043061.0,
"step": 98
},
{
"epoch": 1.2531645569620253,
"grad_norm": 0.16736926138401031,
"learning_rate": 0.00013298165617981172,
"loss": 0.121,
"mean_token_accuracy": 0.9673892855644226,
"num_tokens": 2064713.0,
"step": 99
},
{
"epoch": 1.2658227848101267,
"grad_norm": 0.14512582123279572,
"learning_rate": 0.0001316834818771535,
"loss": 0.131,
"mean_token_accuracy": 0.9658250212669373,
"num_tokens": 2085728.0,
"step": 100
},
{
"epoch": 1.2784810126582278,
"grad_norm": 0.1532108336687088,
"learning_rate": 0.00013037934471093682,
"loss": 0.105,
"mean_token_accuracy": 0.9721629619598389,
"num_tokens": 2105945.0,
"step": 101
},
{
"epoch": 1.2911392405063291,
"grad_norm": 0.16162677109241486,
"learning_rate": 0.00012906949012110456,
"loss": 0.119,
"mean_token_accuracy": 0.9679898619651794,
"num_tokens": 2128127.0,
"step": 102
},
{
"epoch": 1.3037974683544304,
"grad_norm": 0.15701304376125336,
"learning_rate": 0.00012775416462362457,
"loss": 0.1243,
"mean_token_accuracy": 0.9664501547813416,
"num_tokens": 2147744.0,
"step": 103
},
{
"epoch": 1.3164556962025316,
"grad_norm": 0.19801859557628632,
"learning_rate": 0.00012643361576409516,
"loss": 0.1135,
"mean_token_accuracy": 0.9700688719749451,
"num_tokens": 2167119.0,
"step": 104
},
{
"epoch": 1.3291139240506329,
"grad_norm": 0.14806534349918365,
"learning_rate": 0.00012510809207115666,
"loss": 0.1136,
"mean_token_accuracy": 0.9694877862930298,
"num_tokens": 2188912.0,
"step": 105
},
{
"epoch": 1.3417721518987342,
"grad_norm": 0.17883673310279846,
"learning_rate": 0.00012377784300971807,
"loss": 0.1329,
"mean_token_accuracy": 0.9641534090042114,
"num_tokens": 2210568.0,
"step": 106
},
{
"epoch": 1.3544303797468356,
"grad_norm": 0.19047731161117554,
"learning_rate": 0.00012244311893400763,
"loss": 0.1197,
"mean_token_accuracy": 0.9685088396072388,
"num_tokens": 2233051.0,
"step": 107
},
{
"epoch": 1.3670886075949367,
"grad_norm": 0.1676148772239685,
"learning_rate": 0.00012110417104045575,
"loss": 0.119,
"mean_token_accuracy": 0.9676389694213867,
"num_tokens": 2255364.0,
"step": 108
},
{
"epoch": 1.379746835443038,
"grad_norm": 0.14473366737365723,
"learning_rate": 0.00011976125132041974,
"loss": 0.1093,
"mean_token_accuracy": 0.9687408804893494,
"num_tokens": 2275998.0,
"step": 109
},
{
"epoch": 1.3924050632911391,
"grad_norm": 0.1363905370235443,
"learning_rate": 0.00011841461251275867,
"loss": 0.1225,
"mean_token_accuracy": 0.9674336910247803,
"num_tokens": 2298877.0,
"step": 110
},
{
"epoch": 1.4050632911392404,
"grad_norm": 0.15403813123703003,
"learning_rate": 0.0001170645080562676,
"loss": 0.1195,
"mean_token_accuracy": 0.9666731357574463,
"num_tokens": 2319495.0,
"step": 111
},
{
"epoch": 1.4177215189873418,
"grad_norm": 0.12701380252838135,
"learning_rate": 0.00011571119204198037,
"loss": 0.1108,
"mean_token_accuracy": 0.9725146293640137,
"num_tokens": 2341789.0,
"step": 112
},
{
"epoch": 1.4303797468354431,
"grad_norm": 0.15826545655727386,
"learning_rate": 0.00011435491916534919,
"loss": 0.1219,
"mean_token_accuracy": 0.967819094657898,
"num_tokens": 2360249.0,
"step": 113
},
{
"epoch": 1.4430379746835442,
"grad_norm": 0.14779576659202576,
"learning_rate": 0.00011299594467831078,
"loss": 0.1067,
"mean_token_accuracy": 0.9703106880187988,
"num_tokens": 2379175.0,
"step": 114
},
{
"epoch": 1.4556962025316456,
"grad_norm": 0.15034395456314087,
"learning_rate": 0.00011163452434124773,
"loss": 0.123,
"mean_token_accuracy": 0.9687133431434631,
"num_tokens": 2401389.0,
"step": 115
},
{
"epoch": 1.4683544303797469,
"grad_norm": 0.1711132824420929,
"learning_rate": 0.00011027091437485404,
"loss": 0.1106,
"mean_token_accuracy": 0.9697067141532898,
"num_tokens": 2423207.0,
"step": 116
},
{
"epoch": 1.481012658227848,
"grad_norm": 0.15965788066387177,
"learning_rate": 0.00010890537141191417,
"loss": 0.1188,
"mean_token_accuracy": 0.966696560382843,
"num_tokens": 2444470.0,
"step": 117
},
{
"epoch": 1.4936708860759493,
"grad_norm": 0.1709423065185547,
"learning_rate": 0.00010753815244900458,
"loss": 0.1414,
"mean_token_accuracy": 0.9635064005851746,
"num_tokens": 2465798.0,
"step": 118
},
{
"epoch": 1.5063291139240507,
"grad_norm": 0.16524891555309296,
"learning_rate": 0.00010616951479812658,
"loss": 0.1198,
"mean_token_accuracy": 0.9672353863716125,
"num_tokens": 2486494.0,
"step": 119
},
{
"epoch": 1.518987341772152,
"grad_norm": 0.1784825325012207,
"learning_rate": 0.00010479971603828,
"loss": 0.122,
"mean_token_accuracy": 0.9669795632362366,
"num_tokens": 2507757.0,
"step": 120
},
{
"epoch": 1.5316455696202531,
"grad_norm": 0.18025313317775726,
"learning_rate": 0.00010342901396698659,
"loss": 0.1217,
"mean_token_accuracy": 0.9672725796699524,
"num_tokens": 2528507.0,
"step": 121
},
{
"epoch": 1.5443037974683544,
"grad_norm": 0.15038174390792847,
"learning_rate": 0.00010205766655177215,
"loss": 0.1047,
"mean_token_accuracy": 0.9724980592727661,
"num_tokens": 2550424.0,
"step": 122
},
{
"epoch": 1.5569620253164556,
"grad_norm": 0.14482751488685608,
"learning_rate": 0.00010068593188161697,
"loss": 0.1171,
"mean_token_accuracy": 0.9675801396369934,
"num_tokens": 2569828.0,
"step": 123
},
{
"epoch": 1.5696202531645569,
"grad_norm": 0.13739396631717682,
"learning_rate": 9.931406811838308e-05,
"loss": 0.1,
"mean_token_accuracy": 0.973212718963623,
"num_tokens": 2592776.0,
"step": 124
},
{
"epoch": 1.5822784810126582,
"grad_norm": 0.15288740396499634,
"learning_rate": 9.79423334482279e-05,
"loss": 0.1221,
"mean_token_accuracy": 0.9669612646102905,
"num_tokens": 2612302.0,
"step": 125
},
{
"epoch": 1.5949367088607596,
"grad_norm": 0.21149307489395142,
"learning_rate": 9.657098603301346e-05,
"loss": 0.1232,
"mean_token_accuracy": 0.9651282429695129,
"num_tokens": 2631780.0,
"step": 126
},
{
"epoch": 1.6075949367088609,
"grad_norm": 0.1493978202342987,
"learning_rate": 9.520028396172003e-05,
"loss": 0.1189,
"mean_token_accuracy": 0.9693233966827393,
"num_tokens": 2652772.0,
"step": 127
},
{
"epoch": 1.620253164556962,
"grad_norm": 0.13895590603351593,
"learning_rate": 9.383048520187344e-05,
"loss": 0.0915,
"mean_token_accuracy": 0.9748296141624451,
"num_tokens": 2674846.0,
"step": 128
},
{
"epoch": 1.6329113924050633,
"grad_norm": 0.1659339815378189,
"learning_rate": 9.246184755099545e-05,
"loss": 0.1304,
"mean_token_accuracy": 0.9650869369506836,
"num_tokens": 2695504.0,
"step": 129
},
{
"epoch": 1.6455696202531644,
"grad_norm": 0.18495714664459229,
"learning_rate": 9.109462858808586e-05,
"loss": 0.1345,
"mean_token_accuracy": 0.9641679525375366,
"num_tokens": 2716499.0,
"step": 130
},
{
"epoch": 1.6582278481012658,
"grad_norm": 0.1656477451324463,
"learning_rate": 8.972908562514598e-05,
"loss": 0.1257,
"mean_token_accuracy": 0.9681254029273987,
"num_tokens": 2739528.0,
"step": 131
},
{
"epoch": 1.6708860759493671,
"grad_norm": 0.17554399371147156,
"learning_rate": 8.836547565875227e-05,
"loss": 0.1418,
"mean_token_accuracy": 0.961998462677002,
"num_tokens": 2761749.0,
"step": 132
},
{
"epoch": 1.6835443037974684,
"grad_norm": 0.15592941641807556,
"learning_rate": 8.70040553216892e-05,
"loss": 0.1148,
"mean_token_accuracy": 0.9690976142883301,
"num_tokens": 2781682.0,
"step": 133
},
{
"epoch": 1.6962025316455698,
"grad_norm": 0.1496342271566391,
"learning_rate": 8.564508083465079e-05,
"loss": 0.1133,
"mean_token_accuracy": 0.9688509702682495,
"num_tokens": 2801554.0,
"step": 134
},
{
"epoch": 1.7088607594936709,
"grad_norm": 0.2020542472600937,
"learning_rate": 8.428880795801965e-05,
"loss": 0.1479,
"mean_token_accuracy": 0.9599217772483826,
"num_tokens": 2821055.0,
"step": 135
},
{
"epoch": 1.721518987341772,
"grad_norm": 0.176243856549263,
"learning_rate": 8.293549194373243e-05,
"loss": 0.1214,
"mean_token_accuracy": 0.967559278011322,
"num_tokens": 2841957.0,
"step": 136
},
{
"epoch": 1.7341772151898733,
"grad_norm": 0.15299445390701294,
"learning_rate": 8.158538748724139e-05,
"loss": 0.1053,
"mean_token_accuracy": 0.9709796905517578,
"num_tokens": 2863661.0,
"step": 137
},
{
"epoch": 1.7468354430379747,
"grad_norm": 0.1839250922203064,
"learning_rate": 8.023874867958027e-05,
"loss": 0.1235,
"mean_token_accuracy": 0.967279851436615,
"num_tokens": 2883621.0,
"step": 138
},
{
"epoch": 1.759493670886076,
"grad_norm": 0.11831887066364288,
"learning_rate": 7.889582895954427e-05,
"loss": 0.0941,
"mean_token_accuracy": 0.9745250344276428,
"num_tokens": 2904529.0,
"step": 139
},
{
"epoch": 1.7721518987341773,
"grad_norm": 0.1413291096687317,
"learning_rate": 7.755688106599241e-05,
"loss": 0.1114,
"mean_token_accuracy": 0.968601405620575,
"num_tokens": 2923097.0,
"step": 140
},
{
"epoch": 1.7848101265822784,
"grad_norm": 0.1475374400615692,
"learning_rate": 7.622215699028196e-05,
"loss": 0.1143,
"mean_token_accuracy": 0.9688102006912231,
"num_tokens": 2942366.0,
"step": 141
},
{
"epoch": 1.7974683544303798,
"grad_norm": 0.1440063714981079,
"learning_rate": 7.489190792884338e-05,
"loss": 0.1139,
"mean_token_accuracy": 0.9701301455497742,
"num_tokens": 2965095.0,
"step": 142
},
{
"epoch": 1.810126582278481,
"grad_norm": 0.1474955677986145,
"learning_rate": 7.356638423590485e-05,
"loss": 0.1299,
"mean_token_accuracy": 0.9650708436965942,
"num_tokens": 2986402.0,
"step": 143
},
{
"epoch": 1.8227848101265822,
"grad_norm": 0.13343898952007294,
"learning_rate": 7.224583537637544e-05,
"loss": 0.1,
"mean_token_accuracy": 0.9724212288856506,
"num_tokens": 3006844.0,
"step": 144
},
{
"epoch": 1.8354430379746836,
"grad_norm": 0.1628241240978241,
"learning_rate": 7.093050987889547e-05,
"loss": 0.1064,
"mean_token_accuracy": 0.9713687896728516,
"num_tokens": 3027934.0,
"step": 145
},
{
"epoch": 1.8481012658227849,
"grad_norm": 0.18010802567005157,
"learning_rate": 6.96206552890632e-05,
"loss": 0.1346,
"mean_token_accuracy": 0.9642553329467773,
"num_tokens": 3047973.0,
"step": 146
},
{
"epoch": 1.8607594936708862,
"grad_norm": 0.1424276977777481,
"learning_rate": 6.831651812284652e-05,
"loss": 0.1023,
"mean_token_accuracy": 0.9724918007850647,
"num_tokens": 3068540.0,
"step": 147
},
{
"epoch": 1.8734177215189873,
"grad_norm": 0.16791187226772308,
"learning_rate": 6.701834382018832e-05,
"loss": 0.1372,
"mean_token_accuracy": 0.9635747075080872,
"num_tokens": 3089551.0,
"step": 148
},
{
"epoch": 1.8860759493670884,
"grad_norm": 0.15886037051677704,
"learning_rate": 6.572637669881458e-05,
"loss": 0.1203,
"mean_token_accuracy": 0.9681239724159241,
"num_tokens": 3109881.0,
"step": 149
},
{
"epoch": 1.8987341772151898,
"grad_norm": 0.15515190362930298,
"learning_rate": 6.444085990825338e-05,
"loss": 0.1274,
"mean_token_accuracy": 0.967353343963623,
"num_tokens": 3129702.0,
"step": 150
},
{
"epoch": 1.9113924050632911,
"grad_norm": 0.15266196429729462,
"learning_rate": 6.316203538407397e-05,
"loss": 0.1059,
"mean_token_accuracy": 0.9698867797851562,
"num_tokens": 3149724.0,
"step": 151
},
{
"epoch": 1.9240506329113924,
"grad_norm": 0.15055519342422485,
"learning_rate": 6.18901438023543e-05,
"loss": 0.104,
"mean_token_accuracy": 0.97203129529953,
"num_tokens": 3170883.0,
"step": 152
},
{
"epoch": 1.9367088607594938,
"grad_norm": 0.14458802342414856,
"learning_rate": 6.0625424534385425e-05,
"loss": 0.1089,
"mean_token_accuracy": 0.9710777997970581,
"num_tokens": 3192695.0,
"step": 153
},
{
"epoch": 1.9493670886075949,
"grad_norm": 0.13979317247867584,
"learning_rate": 5.936811560162169e-05,
"loss": 0.0934,
"mean_token_accuracy": 0.9752629995346069,
"num_tokens": 3213578.0,
"step": 154
},
{
"epoch": 1.9620253164556962,
"grad_norm": 0.16508439183235168,
"learning_rate": 5.811845363088477e-05,
"loss": 0.1063,
"mean_token_accuracy": 0.9713494181632996,
"num_tokens": 3235666.0,
"step": 155
},
{
"epoch": 1.9746835443037973,
"grad_norm": 0.1382744163274765,
"learning_rate": 5.687667380983037e-05,
"loss": 0.1046,
"mean_token_accuracy": 0.9724194407463074,
"num_tokens": 3256433.0,
"step": 156
},
{
"epoch": 1.9873417721518987,
"grad_norm": 0.15038706362247467,
"learning_rate": 5.5643009842685554e-05,
"loss": 0.1107,
"mean_token_accuracy": 0.9704877138137817,
"num_tokens": 3279030.0,
"step": 157
},
{
"epoch": 2.0,
"grad_norm": 0.11997652798891068,
"learning_rate": 5.4417693906265365e-05,
"loss": 0.0832,
"mean_token_accuracy": 0.9756409525871277,
"num_tokens": 3297855.0,
"step": 158
},
{
"epoch": 2.0126582278481013,
"grad_norm": 0.12818469107151031,
"learning_rate": 5.3200956606277006e-05,
"loss": 0.1002,
"mean_token_accuracy": 0.9725956320762634,
"num_tokens": 3319193.0,
"step": 159
},
{
"epoch": 2.0253164556962027,
"grad_norm": 0.14221195876598358,
"learning_rate": 5.199302693391959e-05,
"loss": 0.1014,
"mean_token_accuracy": 0.9717661142349243,
"num_tokens": 3339658.0,
"step": 160
},
{
"epoch": 2.037974683544304,
"grad_norm": 0.13688071072101593,
"learning_rate": 5.0794132222787707e-05,
"loss": 0.0942,
"mean_token_accuracy": 0.9738968014717102,
"num_tokens": 3361635.0,
"step": 161
},
{
"epoch": 2.050632911392405,
"grad_norm": 0.11703404784202576,
"learning_rate": 4.960449810608705e-05,
"loss": 0.0804,
"mean_token_accuracy": 0.9769234657287598,
"num_tokens": 3382326.0,
"step": 162
},
{
"epoch": 2.0632911392405062,
"grad_norm": 0.13432802259922028,
"learning_rate": 4.8424348474170014e-05,
"loss": 0.0857,
"mean_token_accuracy": 0.9762054085731506,
"num_tokens": 3403109.0,
"step": 163
},
{
"epoch": 2.0759493670886076,
"grad_norm": 0.12041960656642914,
"learning_rate": 4.725390543239929e-05,
"loss": 0.073,
"mean_token_accuracy": 0.978657066822052,
"num_tokens": 3425616.0,
"step": 164
},
{
"epoch": 2.088607594936709,
"grad_norm": 0.18753547966480255,
"learning_rate": 4.609338925934743e-05,
"loss": 0.0893,
"mean_token_accuracy": 0.9740729928016663,
"num_tokens": 3445852.0,
"step": 165
},
{
"epoch": 2.1012658227848102,
"grad_norm": 0.17938809096813202,
"learning_rate": 4.494301836534016e-05,
"loss": 0.0875,
"mean_token_accuracy": 0.9756035208702087,
"num_tokens": 3465427.0,
"step": 166
},
{
"epoch": 2.1139240506329116,
"grad_norm": 0.18644244968891144,
"learning_rate": 4.380300925135138e-05,
"loss": 0.0844,
"mean_token_accuracy": 0.9756962060928345,
"num_tokens": 3485529.0,
"step": 167
},
{
"epoch": 2.1265822784810124,
"grad_norm": 0.17335088551044464,
"learning_rate": 4.267357646825746e-05,
"loss": 0.0814,
"mean_token_accuracy": 0.9768072962760925,
"num_tokens": 3506591.0,
"step": 168
},
{
"epoch": 2.1392405063291138,
"grad_norm": 0.21782517433166504,
"learning_rate": 4.1554932576458415e-05,
"loss": 0.1137,
"mean_token_accuracy": 0.9687607288360596,
"num_tokens": 3527014.0,
"step": 169
},
{
"epoch": 2.151898734177215,
"grad_norm": 0.20455828309059143,
"learning_rate": 4.044728810587406e-05,
"loss": 0.0962,
"mean_token_accuracy": 0.9728721976280212,
"num_tokens": 3548532.0,
"step": 170
},
{
"epoch": 2.1645569620253164,
"grad_norm": 0.146736741065979,
"learning_rate": 3.935085151632185e-05,
"loss": 0.0808,
"mean_token_accuracy": 0.978145182132721,
"num_tokens": 3571337.0,
"step": 171
},
{
"epoch": 2.1772151898734178,
"grad_norm": 0.1688258796930313,
"learning_rate": 3.826582915828468e-05,
"loss": 0.0881,
"mean_token_accuracy": 0.9753274321556091,
"num_tokens": 3593085.0,
"step": 172
},
{
"epoch": 2.189873417721519,
"grad_norm": 0.13930419087409973,
"learning_rate": 3.719242523407539e-05,
"loss": 0.0803,
"mean_token_accuracy": 0.9768635034561157,
"num_tokens": 3611864.0,
"step": 173
},
{
"epoch": 2.2025316455696204,
"grad_norm": 0.14071966707706451,
"learning_rate": 3.613084175940578e-05,
"loss": 0.0804,
"mean_token_accuracy": 0.9770142436027527,
"num_tokens": 3632767.0,
"step": 174
},
{
"epoch": 2.2151898734177213,
"grad_norm": 0.1428343951702118,
"learning_rate": 3.508127852536698e-05,
"loss": 0.0797,
"mean_token_accuracy": 0.9772024154663086,
"num_tokens": 3652877.0,
"step": 175
},
{
"epoch": 2.2278481012658227,
"grad_norm": 0.21315431594848633,
"learning_rate": 3.4043933060828605e-05,
"loss": 0.0888,
"mean_token_accuracy": 0.9752591252326965,
"num_tokens": 3673393.0,
"step": 176
},
{
"epoch": 2.240506329113924,
"grad_norm": 0.13567057251930237,
"learning_rate": 3.3019000595263574e-05,
"loss": 0.0723,
"mean_token_accuracy": 0.9791584610939026,
"num_tokens": 3696248.0,
"step": 177
},
{
"epoch": 2.2531645569620253,
"grad_norm": 0.11285153776407242,
"learning_rate": 3.200667402200586e-05,
"loss": 0.0714,
"mean_token_accuracy": 0.9794472455978394,
"num_tokens": 3716358.0,
"step": 178
},
{
"epoch": 2.2658227848101267,
"grad_norm": 0.12942923605442047,
"learning_rate": 3.100714386194757e-05,
"loss": 0.07,
"mean_token_accuracy": 0.9789379239082336,
"num_tokens": 3736458.0,
"step": 179
},
{
"epoch": 2.278481012658228,
"grad_norm": 0.16876453161239624,
"learning_rate": 3.0020598227682795e-05,
"loss": 0.0893,
"mean_token_accuracy": 0.9735265970230103,
"num_tokens": 3754389.0,
"step": 180
},
{
"epoch": 2.291139240506329,
"grad_norm": 0.15007387101650238,
"learning_rate": 2.904722278810471e-05,
"loss": 0.077,
"mean_token_accuracy": 0.9764189124107361,
"num_tokens": 3775614.0,
"step": 181
},
{
"epoch": 2.3037974683544302,
"grad_norm": 0.1313251107931137,
"learning_rate": 2.8087200733462425e-05,
"loss": 0.0736,
"mean_token_accuracy": 0.978974461555481,
"num_tokens": 3798222.0,
"step": 182
},
{
"epoch": 2.3164556962025316,
"grad_norm": 0.12241403013467789,
"learning_rate": 2.7140712740884376e-05,
"loss": 0.0734,
"mean_token_accuracy": 0.978549063205719,
"num_tokens": 3819031.0,
"step": 183
},
{
"epoch": 2.329113924050633,
"grad_norm": 0.13866658508777618,
"learning_rate": 2.6207936940374767e-05,
"loss": 0.0856,
"mean_token_accuracy": 0.975257158279419,
"num_tokens": 3841647.0,
"step": 184
},
{
"epoch": 2.3417721518987342,
"grad_norm": 0.1442888230085373,
"learning_rate": 2.5289048881289256e-05,
"loss": 0.0747,
"mean_token_accuracy": 0.9778075814247131,
"num_tokens": 3861853.0,
"step": 185
},
{
"epoch": 2.3544303797468356,
"grad_norm": 0.13721716403961182,
"learning_rate": 2.4384221499296466e-05,
"loss": 0.0769,
"mean_token_accuracy": 0.9777352213859558,
"num_tokens": 3881230.0,
"step": 186
},
{
"epoch": 2.367088607594937,
"grad_norm": 0.1602994054555893,
"learning_rate": 2.3493625083831217e-05,
"loss": 0.0794,
"mean_token_accuracy": 0.9766371846199036,
"num_tokens": 3900641.0,
"step": 187
},
{
"epoch": 2.379746835443038,
"grad_norm": 0.13312046229839325,
"learning_rate": 2.2617427246045973e-05,
"loss": 0.0815,
"mean_token_accuracy": 0.976757824420929,
"num_tokens": 3922863.0,
"step": 188
},
{
"epoch": 2.392405063291139,
"grad_norm": 0.1182788833975792,
"learning_rate": 2.1755792887266234e-05,
"loss": 0.073,
"mean_token_accuracy": 0.9789871573448181,
"num_tokens": 3944628.0,
"step": 189
},
{
"epoch": 2.4050632911392404,
"grad_norm": 0.126333549618721,
"learning_rate": 2.0908884167955824e-05,
"loss": 0.0751,
"mean_token_accuracy": 0.9801375865936279,
"num_tokens": 3967952.0,
"step": 190
},
{
"epoch": 2.4177215189873418,
"grad_norm": 0.163629412651062,
"learning_rate": 2.0076860477198313e-05,
"loss": 0.0836,
"mean_token_accuracy": 0.9764661192893982,
"num_tokens": 3989177.0,
"step": 191
},
{
"epoch": 2.430379746835443,
"grad_norm": 0.14649328589439392,
"learning_rate": 1.9259878402699705e-05,
"loss": 0.0758,
"mean_token_accuracy": 0.9769569039344788,
"num_tokens": 4009247.0,
"step": 192
},
{
"epoch": 2.4430379746835444,
"grad_norm": 0.1750485897064209,
"learning_rate": 1.8458091701318504e-05,
"loss": 0.0977,
"mean_token_accuracy": 0.9716680645942688,
"num_tokens": 4030665.0,
"step": 193
},
{
"epoch": 2.4556962025316453,
"grad_norm": 0.15362712740898132,
"learning_rate": 1.7671651270128532e-05,
"loss": 0.0803,
"mean_token_accuracy": 0.9766944646835327,
"num_tokens": 4050381.0,
"step": 194
},
{
"epoch": 2.4683544303797467,
"grad_norm": 0.1784805804491043,
"learning_rate": 1.69007051180199e-05,
"loss": 0.0789,
"mean_token_accuracy": 0.9765030145645142,
"num_tokens": 4068575.0,
"step": 195
},
{
"epoch": 2.481012658227848,
"grad_norm": 0.17262433469295502,
"learning_rate": 1.6145398337843652e-05,
"loss": 0.0809,
"mean_token_accuracy": 0.9770630598068237,
"num_tokens": 4088258.0,
"step": 196
},
{
"epoch": 2.4936708860759493,
"grad_norm": 0.127259761095047,
"learning_rate": 1.540587307910508e-05,
"loss": 0.0676,
"mean_token_accuracy": 0.9799794554710388,
"num_tokens": 4109750.0,
"step": 197
},
{
"epoch": 2.5063291139240507,
"grad_norm": 0.14667996764183044,
"learning_rate": 1.4682268521211073e-05,
"loss": 0.0805,
"mean_token_accuracy": 0.9765044450759888,
"num_tokens": 4130669.0,
"step": 198
},
{
"epoch": 2.518987341772152,
"grad_norm": 0.1387241631746292,
"learning_rate": 1.3974720847276412e-05,
"loss": 0.0885,
"mean_token_accuracy": 0.9746710062026978,
"num_tokens": 4149960.0,
"step": 199
},
{
"epoch": 2.5316455696202533,
"grad_norm": 0.14381346106529236,
"learning_rate": 1.328336321849396e-05,
"loss": 0.0777,
"mean_token_accuracy": 0.9765580892562866,
"num_tokens": 4171140.0,
"step": 200
},
{
"epoch": 2.5443037974683547,
"grad_norm": 0.15454328060150146,
"learning_rate": 1.2608325749073591e-05,
"loss": 0.0775,
"mean_token_accuracy": 0.9783006906509399,
"num_tokens": 4191942.0,
"step": 201
},
{
"epoch": 2.5569620253164556,
"grad_norm": 0.16802901029586792,
"learning_rate": 1.1949735481754565e-05,
"loss": 0.0872,
"mean_token_accuracy": 0.9753664135932922,
"num_tokens": 4212953.0,
"step": 202
},
{
"epoch": 2.569620253164557,
"grad_norm": 0.14280477166175842,
"learning_rate": 1.130771636389596e-05,
"loss": 0.0766,
"mean_token_accuracy": 0.9774961471557617,
"num_tokens": 4235191.0,
"step": 203
},
{
"epoch": 2.5822784810126582,
"grad_norm": 0.15136970579624176,
"learning_rate": 1.0682389224149647e-05,
"loss": 0.0761,
"mean_token_accuracy": 0.9784093499183655,
"num_tokens": 4256190.0,
"step": 204
},
{
"epoch": 2.5949367088607596,
"grad_norm": 0.15056195855140686,
"learning_rate": 1.0073871749720221e-05,
"loss": 0.0715,
"mean_token_accuracy": 0.9787655472755432,
"num_tokens": 4278482.0,
"step": 205
},
{
"epoch": 2.607594936708861,
"grad_norm": 0.1651993989944458,
"learning_rate": 9.482278464216121e-06,
"loss": 0.0838,
"mean_token_accuracy": 0.9761291146278381,
"num_tokens": 4299115.0,
"step": 206
},
{
"epoch": 2.620253164556962,
"grad_norm": 0.16099077463150024,
"learning_rate": 8.907720706096224e-06,
"loss": 0.083,
"mean_token_accuracy": 0.9754238724708557,
"num_tokens": 4318995.0,
"step": 207
},
{
"epoch": 2.632911392405063,
"grad_norm": 0.14827919006347656,
"learning_rate": 8.350306607715774e-06,
"loss": 0.0739,
"mean_token_accuracy": 0.977802574634552,
"num_tokens": 4340548.0,
"step": 208
},
{
"epoch": 2.6455696202531644,
"grad_norm": 0.14395387470722198,
"learning_rate": 7.810141074975818e-06,
"loss": 0.0793,
"mean_token_accuracy": 0.9785593748092651,
"num_tokens": 4359548.0,
"step": 209
},
{
"epoch": 2.6582278481012658,
"grad_norm": 0.15039250254631042,
"learning_rate": 7.287325767579756e-06,
"loss": 0.0775,
"mean_token_accuracy": 0.9778735637664795,
"num_tokens": 4378865.0,
"step": 210
},
{
"epoch": 2.670886075949367,
"grad_norm": 0.1650187373161316,
"learning_rate": 6.781959079900957e-06,
"loss": 0.0838,
"mean_token_accuracy": 0.9761627912521362,
"num_tokens": 4399569.0,
"step": 211
},
{
"epoch": 2.6835443037974684,
"grad_norm": 0.14305095374584198,
"learning_rate": 6.2941361224647e-06,
"loss": 0.0741,
"mean_token_accuracy": 0.9784291982650757,
"num_tokens": 4422488.0,
"step": 212
},
{
"epoch": 2.6962025316455698,
"grad_norm": 0.15657547116279602,
"learning_rate": 5.823948704048443e-06,
"loss": 0.0767,
"mean_token_accuracy": 0.9773022532463074,
"num_tokens": 4443347.0,
"step": 213
},
{
"epoch": 2.708860759493671,
"grad_norm": 0.14245574176311493,
"learning_rate": 5.371485314403202e-06,
"loss": 0.0772,
"mean_token_accuracy": 0.9766822457313538,
"num_tokens": 4465197.0,
"step": 214
},
{
"epoch": 2.721518987341772,
"grad_norm": 0.16059687733650208,
"learning_rate": 4.936831107599749e-06,
"loss": 0.0868,
"mean_token_accuracy": 0.9753717184066772,
"num_tokens": 4486984.0,
"step": 215
},
{
"epoch": 2.7341772151898733,
"grad_norm": 0.16994109749794006,
"learning_rate": 4.5200678860024885e-06,
"loss": 0.0907,
"mean_token_accuracy": 0.9752695560455322,
"num_tokens": 4506619.0,
"step": 216
},
{
"epoch": 2.7468354430379747,
"grad_norm": 0.14966760575771332,
"learning_rate": 4.121274084874194e-06,
"loss": 0.086,
"mean_token_accuracy": 0.9755901098251343,
"num_tokens": 4527781.0,
"step": 217
},
{
"epoch": 2.759493670886076,
"grad_norm": 0.16135965287685394,
"learning_rate": 3.7405247576144054e-06,
"loss": 0.0825,
"mean_token_accuracy": 0.976494312286377,
"num_tokens": 4547670.0,
"step": 218
},
{
"epoch": 2.7721518987341773,
"grad_norm": 0.13386498391628265,
"learning_rate": 3.3778915616342943e-06,
"loss": 0.0773,
"mean_token_accuracy": 0.9776089787483215,
"num_tokens": 4570511.0,
"step": 219
},
{
"epoch": 2.7848101265822782,
"grad_norm": 0.14860939979553223,
"learning_rate": 3.0334427448706847e-06,
"loss": 0.0818,
"mean_token_accuracy": 0.9759284257888794,
"num_tokens": 4590017.0,
"step": 220
},
{
"epoch": 2.7974683544303796,
"grad_norm": 0.1305076777935028,
"learning_rate": 2.707243132941717e-06,
"loss": 0.0746,
"mean_token_accuracy": 0.9780017733573914,
"num_tokens": 4610219.0,
"step": 221
},
{
"epoch": 2.810126582278481,
"grad_norm": 0.14003509283065796,
"learning_rate": 2.3993541169465837e-06,
"loss": 0.0841,
"mean_token_accuracy": 0.9770644307136536,
"num_tokens": 4631778.0,
"step": 222
},
{
"epoch": 2.8227848101265822,
"grad_norm": 0.1698557734489441,
"learning_rate": 2.1098336419116625e-06,
"loss": 0.0776,
"mean_token_accuracy": 0.9789777994155884,
"num_tokens": 4654675.0,
"step": 223
},
{
"epoch": 2.8354430379746836,
"grad_norm": 0.1640406996011734,
"learning_rate": 1.838736195885238e-06,
"loss": 0.0761,
"mean_token_accuracy": 0.9789262413978577,
"num_tokens": 4674669.0,
"step": 224
},
{
"epoch": 2.848101265822785,
"grad_norm": 0.17419269680976868,
"learning_rate": 1.5861127996827597e-06,
"loss": 0.0812,
"mean_token_accuracy": 0.9762682914733887,
"num_tokens": 4695844.0,
"step": 225
},
{
"epoch": 2.8607594936708862,
"grad_norm": 0.16612987220287323,
"learning_rate": 1.3520109972846917e-06,
"loss": 0.0801,
"mean_token_accuracy": 0.9774113893508911,
"num_tokens": 4715741.0,
"step": 226
},
{
"epoch": 2.8734177215189876,
"grad_norm": 0.15979738533496857,
"learning_rate": 1.1364748468886687e-06,
"loss": 0.0888,
"mean_token_accuracy": 0.9751821160316467,
"num_tokens": 4736395.0,
"step": 227
},
{
"epoch": 2.8860759493670884,
"grad_norm": 0.15005967020988464,
"learning_rate": 9.395449126177291e-07,
"loss": 0.0765,
"mean_token_accuracy": 0.9786757826805115,
"num_tokens": 4759250.0,
"step": 228
},
{
"epoch": 2.8987341772151898,
"grad_norm": 0.13539956510066986,
"learning_rate": 7.612582568860549e-07,
"loss": 0.0776,
"mean_token_accuracy": 0.9776937365531921,
"num_tokens": 4779936.0,
"step": 229
},
{
"epoch": 2.911392405063291,
"grad_norm": 0.15969063341617584,
"learning_rate": 6.016484334238515e-07,
"loss": 0.0913,
"mean_token_accuracy": 0.9742149114608765,
"num_tokens": 4800826.0,
"step": 230
},
{
"epoch": 2.9240506329113924,
"grad_norm": 0.16468146443367004,
"learning_rate": 4.607454809624434e-07,
"loss": 0.0924,
"mean_token_accuracy": 0.9755955338478088,
"num_tokens": 4821501.0,
"step": 231
},
{
"epoch": 2.9367088607594938,
"grad_norm": 0.13484787940979004,
"learning_rate": 3.385759175809966e-07,
"loss": 0.0782,
"mean_token_accuracy": 0.9774335622787476,
"num_tokens": 4841772.0,
"step": 232
},
{
"epoch": 2.9493670886075947,
"grad_norm": 0.1467486321926117,
"learning_rate": 2.3516273571577708e-07,
"loss": 0.0817,
"mean_token_accuracy": 0.9767971634864807,
"num_tokens": 4865109.0,
"step": 233
},
{
"epoch": 2.962025316455696,
"grad_norm": 0.18683797121047974,
"learning_rate": 1.505253978329235e-07,
"loss": 0.0899,
"mean_token_accuracy": 0.975134551525116,
"num_tokens": 4884678.0,
"step": 234
},
{
"epoch": 2.9746835443037973,
"grad_norm": 0.15372681617736816,
"learning_rate": 8.467983276563284e-08,
"loss": 0.081,
"mean_token_accuracy": 0.976805567741394,
"num_tokens": 4906342.0,
"step": 235
},
{
"epoch": 2.9873417721518987,
"grad_norm": 0.15492376685142517,
"learning_rate": 3.763843271631373e-08,
"loss": 0.0778,
"mean_token_accuracy": 0.9773779511451721,
"num_tokens": 4927138.0,
"step": 236
},
{
"epoch": 3.0,
"grad_norm": 0.13269944489002228,
"learning_rate": 9.410050924374415e-09,
"loss": 0.076,
"mean_token_accuracy": 0.9784287810325623,
"num_tokens": 4948434.0,
"step": 237
},
{
"epoch": 3.0,
"step": 237,
"total_flos": 4.5754586889610854e+17,
"train_loss": 0.17737930308917405,
"train_runtime": 1187.0603,
"train_samples_per_second": 12.636,
"train_steps_per_second": 0.2
}
],
"logging_steps": 1.0,
"max_steps": 237,
"num_input_tokens_seen": 0,
"num_train_epochs": 3,
"save_steps": 100,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": true
},
"attributes": {}
}
},
"total_flos": 4.5754586889610854e+17,
"train_batch_size": 16,
"trial_name": null,
"trial_params": null
}