LLM-continual-learning / trace /seq /order5 /trainer_state.json
YeMoKoo's picture
Add final checkpoint: trace_seq_order5
f49fc29 verified
Raw
History Blame Contribute Delete
60.1 kB
{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 2.968152866242038,
"eval_steps": 500,
"global_step": 234,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.012738853503184714,
"grad_norm": 4.032490253448486,
"learning_rate": 0.0,
"loss": 1.8275,
"mean_token_accuracy": 0.6403467357158661,
"num_tokens": 20782.0,
"step": 1
},
{
"epoch": 0.025477707006369428,
"grad_norm": 4.02821683883667,
"learning_rate": 2.5e-05,
"loss": 1.8101,
"mean_token_accuracy": 0.6456336379051208,
"num_tokens": 41801.0,
"step": 2
},
{
"epoch": 0.03821656050955414,
"grad_norm": 2.6589291095733643,
"learning_rate": 5e-05,
"loss": 1.666,
"mean_token_accuracy": 0.6547168493270874,
"num_tokens": 62978.0,
"step": 3
},
{
"epoch": 0.050955414012738856,
"grad_norm": 2.0679564476013184,
"learning_rate": 7.500000000000001e-05,
"loss": 1.4185,
"mean_token_accuracy": 0.6894981861114502,
"num_tokens": 85034.0,
"step": 4
},
{
"epoch": 0.06369426751592357,
"grad_norm": 1.1579885482788086,
"learning_rate": 0.0001,
"loss": 1.3053,
"mean_token_accuracy": 0.6996746063232422,
"num_tokens": 107185.0,
"step": 5
},
{
"epoch": 0.07643312101910828,
"grad_norm": 0.8610864281654358,
"learning_rate": 0.000125,
"loss": 1.1499,
"mean_token_accuracy": 0.720809280872345,
"num_tokens": 127806.0,
"step": 6
},
{
"epoch": 0.08917197452229299,
"grad_norm": 0.9501633644104004,
"learning_rate": 0.00015000000000000001,
"loss": 1.0344,
"mean_token_accuracy": 0.7437184154987335,
"num_tokens": 148231.0,
"step": 7
},
{
"epoch": 0.10191082802547771,
"grad_norm": 1.209609031677246,
"learning_rate": 0.000175,
"loss": 0.9364,
"mean_token_accuracy": 0.7647237181663513,
"num_tokens": 169757.0,
"step": 8
},
{
"epoch": 0.11464968152866242,
"grad_norm": 0.8404257297515869,
"learning_rate": 0.0002,
"loss": 0.8312,
"mean_token_accuracy": 0.7892735302448273,
"num_tokens": 190207.0,
"step": 9
},
{
"epoch": 0.12738853503184713,
"grad_norm": 0.691281259059906,
"learning_rate": 0.00019999033847063811,
"loss": 0.6679,
"mean_token_accuracy": 0.8296232521533966,
"num_tokens": 209441.0,
"step": 10
},
{
"epoch": 0.14012738853503184,
"grad_norm": 0.6289070844650269,
"learning_rate": 0.00019996135574945544,
"loss": 0.6195,
"mean_token_accuracy": 0.8456655740737915,
"num_tokens": 229789.0,
"step": 11
},
{
"epoch": 0.15286624203821655,
"grad_norm": 0.5578577518463135,
"learning_rate": 0.00019991305743680013,
"loss": 0.5848,
"mean_token_accuracy": 0.8547155559062958,
"num_tokens": 250645.0,
"step": 12
},
{
"epoch": 0.16560509554140126,
"grad_norm": 0.5704829692840576,
"learning_rate": 0.0001998454528653836,
"loss": 0.5061,
"mean_token_accuracy": 0.8722218573093414,
"num_tokens": 271375.0,
"step": 13
},
{
"epoch": 0.17834394904458598,
"grad_norm": 0.5471704602241516,
"learning_rate": 0.00019975855509847686,
"loss": 0.4757,
"mean_token_accuracy": 0.8858338296413422,
"num_tokens": 292499.0,
"step": 14
},
{
"epoch": 0.1910828025477707,
"grad_norm": 0.5097174048423767,
"learning_rate": 0.00019965238092738643,
"loss": 0.5191,
"mean_token_accuracy": 0.8713619709014893,
"num_tokens": 313755.0,
"step": 15
},
{
"epoch": 0.20382165605095542,
"grad_norm": 0.43789729475975037,
"learning_rate": 0.00019952695086820975,
"loss": 0.381,
"mean_token_accuracy": 0.9017090201377869,
"num_tokens": 335462.0,
"step": 16
},
{
"epoch": 0.21656050955414013,
"grad_norm": 0.45297467708587646,
"learning_rate": 0.0001993822891578708,
"loss": 0.4286,
"mean_token_accuracy": 0.8946053981781006,
"num_tokens": 355712.0,
"step": 17
},
{
"epoch": 0.22929936305732485,
"grad_norm": 0.4537133276462555,
"learning_rate": 0.0001992184237494368,
"loss": 0.3651,
"mean_token_accuracy": 0.912791520357132,
"num_tokens": 376658.0,
"step": 18
},
{
"epoch": 0.24203821656050956,
"grad_norm": 0.4055041968822479,
"learning_rate": 0.0001990353863067169,
"loss": 0.3392,
"mean_token_accuracy": 0.915442943572998,
"num_tokens": 396622.0,
"step": 19
},
{
"epoch": 0.25477707006369427,
"grad_norm": 0.5385339856147766,
"learning_rate": 0.0001988332121981436,
"loss": 0.3193,
"mean_token_accuracy": 0.9222363233566284,
"num_tokens": 417604.0,
"step": 20
},
{
"epoch": 0.267515923566879,
"grad_norm": 0.39093685150146484,
"learning_rate": 0.00019861194048993863,
"loss": 0.3171,
"mean_token_accuracy": 0.9224121868610382,
"num_tokens": 438312.0,
"step": 21
},
{
"epoch": 0.2802547770700637,
"grad_norm": 0.30290552973747253,
"learning_rate": 0.0001983716139385641,
"loss": 0.2732,
"mean_token_accuracy": 0.9361142218112946,
"num_tokens": 460742.0,
"step": 22
},
{
"epoch": 0.2929936305732484,
"grad_norm": 0.27954092621803284,
"learning_rate": 0.0001981122789824607,
"loss": 0.2555,
"mean_token_accuracy": 0.9381744861602783,
"num_tokens": 481292.0,
"step": 23
},
{
"epoch": 0.3057324840764331,
"grad_norm": 0.33339905738830566,
"learning_rate": 0.00019783398573307428,
"loss": 0.2688,
"mean_token_accuracy": 0.9344040155410767,
"num_tokens": 502883.0,
"step": 24
},
{
"epoch": 0.3184713375796178,
"grad_norm": 0.3911352753639221,
"learning_rate": 0.00019753678796517282,
"loss": 0.2329,
"mean_token_accuracy": 0.9421150088310242,
"num_tokens": 524527.0,
"step": 25
},
{
"epoch": 0.33121019108280253,
"grad_norm": 0.3292308747768402,
"learning_rate": 0.00019722074310645553,
"loss": 0.2635,
"mean_token_accuracy": 0.9353462159633636,
"num_tokens": 543460.0,
"step": 26
},
{
"epoch": 0.34394904458598724,
"grad_norm": 0.23688943684101105,
"learning_rate": 0.00019688591222645607,
"loss": 0.2046,
"mean_token_accuracy": 0.9497671127319336,
"num_tokens": 568256.0,
"step": 27
},
{
"epoch": 0.35668789808917195,
"grad_norm": 0.3945387899875641,
"learning_rate": 0.000196532360024742,
"loss": 0.2345,
"mean_token_accuracy": 0.9450124204158783,
"num_tokens": 590291.0,
"step": 28
},
{
"epoch": 0.36942675159235666,
"grad_norm": 0.28697916865348816,
"learning_rate": 0.0001961601548184129,
"loss": 0.2338,
"mean_token_accuracy": 0.9414379298686981,
"num_tokens": 613204.0,
"step": 29
},
{
"epoch": 0.3821656050955414,
"grad_norm": 0.23970234394073486,
"learning_rate": 0.00019576936852889936,
"loss": 0.2229,
"mean_token_accuracy": 0.9436235725879669,
"num_tokens": 634063.0,
"step": 30
},
{
"epoch": 0.39490445859872614,
"grad_norm": 0.2444416582584381,
"learning_rate": 0.00019536007666806556,
"loss": 0.239,
"mean_token_accuracy": 0.9426109194755554,
"num_tokens": 654939.0,
"step": 31
},
{
"epoch": 0.40764331210191085,
"grad_norm": 0.2546619176864624,
"learning_rate": 0.0001949323583236181,
"loss": 0.2438,
"mean_token_accuracy": 0.9379684627056122,
"num_tokens": 676779.0,
"step": 32
},
{
"epoch": 0.42038216560509556,
"grad_norm": 0.31282731890678406,
"learning_rate": 0.0001944862961438239,
"loss": 0.222,
"mean_token_accuracy": 0.9442552626132965,
"num_tokens": 698151.0,
"step": 33
},
{
"epoch": 0.43312101910828027,
"grad_norm": 0.26302680373191833,
"learning_rate": 0.00019402197632153992,
"loss": 0.2109,
"mean_token_accuracy": 0.9452959597110748,
"num_tokens": 718994.0,
"step": 34
},
{
"epoch": 0.445859872611465,
"grad_norm": 0.22304703295230865,
"learning_rate": 0.00019353948857755803,
"loss": 0.1937,
"mean_token_accuracy": 0.9508229196071625,
"num_tokens": 740812.0,
"step": 35
},
{
"epoch": 0.4585987261146497,
"grad_norm": 0.22195610404014587,
"learning_rate": 0.00019303892614326836,
"loss": 0.2263,
"mean_token_accuracy": 0.9433953166007996,
"num_tokens": 761685.0,
"step": 36
},
{
"epoch": 0.4713375796178344,
"grad_norm": 0.21497657895088196,
"learning_rate": 0.00019252038574264405,
"loss": 0.2319,
"mean_token_accuracy": 0.941495269536972,
"num_tokens": 783640.0,
"step": 37
},
{
"epoch": 0.4840764331210191,
"grad_norm": 0.23853588104248047,
"learning_rate": 0.00019198396757355118,
"loss": 0.2468,
"mean_token_accuracy": 0.9388796389102936,
"num_tokens": 803923.0,
"step": 38
},
{
"epoch": 0.4968152866242038,
"grad_norm": 0.20184901356697083,
"learning_rate": 0.00019142977528838762,
"loss": 0.1935,
"mean_token_accuracy": 0.9509699940681458,
"num_tokens": 824723.0,
"step": 39
},
{
"epoch": 0.5095541401273885,
"grad_norm": 0.2413100302219391,
"learning_rate": 0.00019085791597405404,
"loss": 0.2581,
"mean_token_accuracy": 0.9344974160194397,
"num_tokens": 845317.0,
"step": 40
},
{
"epoch": 0.5222929936305732,
"grad_norm": 0.20988352596759796,
"learning_rate": 0.00019026850013126157,
"loss": 0.1976,
"mean_token_accuracy": 0.9503491222858429,
"num_tokens": 867416.0,
"step": 41
},
{
"epoch": 0.535031847133758,
"grad_norm": 0.22773092985153198,
"learning_rate": 0.00018966164165317966,
"loss": 0.2261,
"mean_token_accuracy": 0.9430988430976868,
"num_tokens": 886904.0,
"step": 42
},
{
"epoch": 0.5477707006369427,
"grad_norm": 0.1990187019109726,
"learning_rate": 0.00018903745780342839,
"loss": 0.1993,
"mean_token_accuracy": 0.9476139545440674,
"num_tokens": 908886.0,
"step": 43
},
{
"epoch": 0.5605095541401274,
"grad_norm": 0.22125588357448578,
"learning_rate": 0.0001883960691934196,
"loss": 0.2352,
"mean_token_accuracy": 0.9444881975650787,
"num_tokens": 929202.0,
"step": 44
},
{
"epoch": 0.5732484076433121,
"grad_norm": 0.22190915048122406,
"learning_rate": 0.00018773759975905098,
"loss": 0.1924,
"mean_token_accuracy": 0.952962726354599,
"num_tokens": 949033.0,
"step": 45
},
{
"epoch": 0.5859872611464968,
"grad_norm": 0.17759603261947632,
"learning_rate": 0.00018706217673675811,
"loss": 0.1921,
"mean_token_accuracy": 0.9519978165626526,
"num_tokens": 971365.0,
"step": 46
},
{
"epoch": 0.5987261146496815,
"grad_norm": 0.19214215874671936,
"learning_rate": 0.0001863699306389282,
"loss": 0.2039,
"mean_token_accuracy": 0.9491439461708069,
"num_tokens": 990739.0,
"step": 47
},
{
"epoch": 0.6114649681528662,
"grad_norm": 0.21507352590560913,
"learning_rate": 0.00018566099522868119,
"loss": 0.2436,
"mean_token_accuracy": 0.9411478042602539,
"num_tokens": 1011450.0,
"step": 48
},
{
"epoch": 0.6242038216560509,
"grad_norm": 0.19679825007915497,
"learning_rate": 0.00018493550749402278,
"loss": 0.212,
"mean_token_accuracy": 0.9487031996250153,
"num_tokens": 1031182.0,
"step": 49
},
{
"epoch": 0.6369426751592356,
"grad_norm": 0.19453713297843933,
"learning_rate": 0.00018419360762137395,
"loss": 0.1815,
"mean_token_accuracy": 0.9539785385131836,
"num_tokens": 1054994.0,
"step": 50
},
{
"epoch": 0.6496815286624203,
"grad_norm": 0.17126353085041046,
"learning_rate": 0.00018343543896848273,
"loss": 0.1878,
"mean_token_accuracy": 0.9533947706222534,
"num_tokens": 1075696.0,
"step": 51
},
{
"epoch": 0.6624203821656051,
"grad_norm": 0.23333708941936493,
"learning_rate": 0.00018266114803672318,
"loss": 0.2263,
"mean_token_accuracy": 0.9433774650096893,
"num_tokens": 1098543.0,
"step": 52
},
{
"epoch": 0.6751592356687898,
"grad_norm": 0.20323054492473602,
"learning_rate": 0.00018187088444278674,
"loss": 0.1637,
"mean_token_accuracy": 0.9572640359401703,
"num_tokens": 1119652.0,
"step": 53
},
{
"epoch": 0.6878980891719745,
"grad_norm": 0.2668849527835846,
"learning_rate": 0.00018106480088977172,
"loss": 0.2186,
"mean_token_accuracy": 0.9467197954654694,
"num_tokens": 1141306.0,
"step": 54
},
{
"epoch": 0.7006369426751592,
"grad_norm": 0.19561052322387695,
"learning_rate": 0.00018024305313767646,
"loss": 0.1896,
"mean_token_accuracy": 0.9518384337425232,
"num_tokens": 1161171.0,
"step": 55
},
{
"epoch": 0.7133757961783439,
"grad_norm": 0.1853981763124466,
"learning_rate": 0.00017940579997330165,
"loss": 0.1952,
"mean_token_accuracy": 0.9492832124233246,
"num_tokens": 1181534.0,
"step": 56
},
{
"epoch": 0.7261146496815286,
"grad_norm": 0.16985760629177094,
"learning_rate": 0.00017855320317956784,
"loss": 0.1697,
"mean_token_accuracy": 0.9568532705307007,
"num_tokens": 1201659.0,
"step": 57
},
{
"epoch": 0.7388535031847133,
"grad_norm": 0.17170517146587372,
"learning_rate": 0.00017768542750425426,
"loss": 0.2227,
"mean_token_accuracy": 0.9445173442363739,
"num_tokens": 1222313.0,
"step": 58
},
{
"epoch": 0.7515923566878981,
"grad_norm": 0.19633768498897552,
"learning_rate": 0.0001768026406281642,
"loss": 0.1681,
"mean_token_accuracy": 0.9575904607772827,
"num_tokens": 1242286.0,
"step": 59
},
{
"epoch": 0.7643312101910829,
"grad_norm": 0.17580056190490723,
"learning_rate": 0.00017590501313272415,
"loss": 0.1845,
"mean_token_accuracy": 0.9523945152759552,
"num_tokens": 1262874.0,
"step": 60
},
{
"epoch": 0.7770700636942676,
"grad_norm": 0.18206478655338287,
"learning_rate": 0.00017499271846702213,
"loss": 0.1985,
"mean_token_accuracy": 0.951472669839859,
"num_tokens": 1282769.0,
"step": 61
},
{
"epoch": 0.7898089171974523,
"grad_norm": 0.2344655692577362,
"learning_rate": 0.00017406593291429217,
"loss": 0.2122,
"mean_token_accuracy": 0.9443674981594086,
"num_tokens": 1304139.0,
"step": 62
},
{
"epoch": 0.802547770700637,
"grad_norm": 0.19128663837909698,
"learning_rate": 0.00017312483555785086,
"loss": 0.2244,
"mean_token_accuracy": 0.943341851234436,
"num_tokens": 1324467.0,
"step": 63
},
{
"epoch": 0.8152866242038217,
"grad_norm": 0.17244233191013336,
"learning_rate": 0.00017216960824649303,
"loss": 0.168,
"mean_token_accuracy": 0.9575148522853851,
"num_tokens": 1345262.0,
"step": 64
},
{
"epoch": 0.8280254777070064,
"grad_norm": 0.17028464376926422,
"learning_rate": 0.00017120043555935298,
"loss": 0.1885,
"mean_token_accuracy": 0.9521305859088898,
"num_tokens": 1368700.0,
"step": 65
},
{
"epoch": 0.8407643312101911,
"grad_norm": 0.20174594223499298,
"learning_rate": 0.0001702175047702382,
"loss": 0.185,
"mean_token_accuracy": 0.9526795446872711,
"num_tokens": 1388344.0,
"step": 66
},
{
"epoch": 0.8535031847133758,
"grad_norm": 0.1811266541481018,
"learning_rate": 0.00016922100581144228,
"loss": 0.1754,
"mean_token_accuracy": 0.9565881788730621,
"num_tokens": 1407723.0,
"step": 67
},
{
"epoch": 0.8662420382165605,
"grad_norm": 0.18422017991542816,
"learning_rate": 0.00016821113123704424,
"loss": 0.1749,
"mean_token_accuracy": 0.9552392363548279,
"num_tokens": 1427747.0,
"step": 68
},
{
"epoch": 0.8789808917197452,
"grad_norm": 0.1854456216096878,
"learning_rate": 0.00016718807618570106,
"loss": 0.1452,
"mean_token_accuracy": 0.9621990919113159,
"num_tokens": 1446729.0,
"step": 69
},
{
"epoch": 0.89171974522293,
"grad_norm": 0.20696918666362762,
"learning_rate": 0.00016615203834294119,
"loss": 0.185,
"mean_token_accuracy": 0.9547071158885956,
"num_tokens": 1466084.0,
"step": 70
},
{
"epoch": 0.9044585987261147,
"grad_norm": 0.22027692198753357,
"learning_rate": 0.00016510321790296525,
"loss": 0.1912,
"mean_token_accuracy": 0.9535127878189087,
"num_tokens": 1485783.0,
"step": 71
},
{
"epoch": 0.9171974522292994,
"grad_norm": 0.16686508059501648,
"learning_rate": 0.00016404181752996289,
"loss": 0.1622,
"mean_token_accuracy": 0.959883451461792,
"num_tokens": 1505907.0,
"step": 72
},
{
"epoch": 0.9299363057324841,
"grad_norm": 0.17605887353420258,
"learning_rate": 0.00016296804231895142,
"loss": 0.165,
"mean_token_accuracy": 0.9578165411949158,
"num_tokens": 1527389.0,
"step": 73
},
{
"epoch": 0.9426751592356688,
"grad_norm": 0.17619065940380096,
"learning_rate": 0.00016188209975614542,
"loss": 0.1561,
"mean_token_accuracy": 0.9601358473300934,
"num_tokens": 1547714.0,
"step": 74
},
{
"epoch": 0.9554140127388535,
"grad_norm": 0.1950807124376297,
"learning_rate": 0.00016078419967886402,
"loss": 0.1984,
"mean_token_accuracy": 0.9482778906822205,
"num_tokens": 1567244.0,
"step": 75
},
{
"epoch": 0.9681528662420382,
"grad_norm": 0.18063174188137054,
"learning_rate": 0.00015967455423498387,
"loss": 0.1802,
"mean_token_accuracy": 0.9535951614379883,
"num_tokens": 1586726.0,
"step": 76
},
{
"epoch": 0.9808917197452229,
"grad_norm": 0.14509689807891846,
"learning_rate": 0.00015855337784194577,
"loss": 0.1411,
"mean_token_accuracy": 0.9627689123153687,
"num_tokens": 1608089.0,
"step": 77
},
{
"epoch": 0.9936305732484076,
"grad_norm": 0.19907675683498383,
"learning_rate": 0.00015742088714532247,
"loss": 0.2119,
"mean_token_accuracy": 0.9476487040519714,
"num_tokens": 1629313.0,
"step": 78
},
{
"epoch": 1.0,
"grad_norm": 0.19907675683498383,
"learning_rate": 0.00015627730097695638,
"loss": 0.1333,
"mean_token_accuracy": 0.9651358127593994,
"num_tokens": 1639470.0,
"step": 79
},
{
"epoch": 1.0127388535031847,
"grad_norm": 0.23832248151302338,
"learning_rate": 0.00015512284031267437,
"loss": 0.1271,
"mean_token_accuracy": 0.9659014642238617,
"num_tokens": 1658148.0,
"step": 80
},
{
"epoch": 1.0254777070063694,
"grad_norm": 0.14923803508281708,
"learning_rate": 0.00015395772822958845,
"loss": 0.1205,
"mean_token_accuracy": 0.9664756953716278,
"num_tokens": 1679412.0,
"step": 81
},
{
"epoch": 1.0382165605095541,
"grad_norm": 0.14769527316093445,
"learning_rate": 0.00015278218986299074,
"loss": 0.1374,
"mean_token_accuracy": 0.9626262485980988,
"num_tokens": 1700169.0,
"step": 82
},
{
"epoch": 1.0509554140127388,
"grad_norm": 0.17680829763412476,
"learning_rate": 0.0001515964523628501,
"loss": 0.125,
"mean_token_accuracy": 0.9658435583114624,
"num_tokens": 1721319.0,
"step": 83
},
{
"epoch": 1.0636942675159236,
"grad_norm": 0.1534733772277832,
"learning_rate": 0.00015040074484992,
"loss": 0.1357,
"mean_token_accuracy": 0.9641449451446533,
"num_tokens": 1741752.0,
"step": 84
},
{
"epoch": 1.0764331210191083,
"grad_norm": 0.1694839596748352,
"learning_rate": 0.00014919529837146528,
"loss": 0.1204,
"mean_token_accuracy": 0.9689095318317413,
"num_tokens": 1763187.0,
"step": 85
},
{
"epoch": 1.089171974522293,
"grad_norm": 0.15279586613178253,
"learning_rate": 0.00014798034585661695,
"loss": 0.1337,
"mean_token_accuracy": 0.9658444821834564,
"num_tokens": 1783640.0,
"step": 86
},
{
"epoch": 1.1019108280254777,
"grad_norm": 0.18650779128074646,
"learning_rate": 0.0001467561220713628,
"loss": 0.1261,
"mean_token_accuracy": 0.9664537906646729,
"num_tokens": 1803457.0,
"step": 87
},
{
"epoch": 1.1146496815286624,
"grad_norm": 0.2114044576883316,
"learning_rate": 0.0001455228635731839,
"loss": 0.1337,
"mean_token_accuracy": 0.9664061665534973,
"num_tokens": 1824664.0,
"step": 88
},
{
"epoch": 1.127388535031847,
"grad_norm": 0.20512934029102325,
"learning_rate": 0.00014428080866534396,
"loss": 0.1456,
"mean_token_accuracy": 0.9614441394805908,
"num_tokens": 1845586.0,
"step": 89
},
{
"epoch": 1.1401273885350318,
"grad_norm": 0.17776310443878174,
"learning_rate": 0.00014303019735084226,
"loss": 0.1425,
"mean_token_accuracy": 0.9611153304576874,
"num_tokens": 1865504.0,
"step": 90
},
{
"epoch": 1.1528662420382165,
"grad_norm": 0.15626613795757294,
"learning_rate": 0.00014177127128603745,
"loss": 0.1281,
"mean_token_accuracy": 0.9677377045154572,
"num_tokens": 1885083.0,
"step": 91
},
{
"epoch": 1.1656050955414012,
"grad_norm": 0.1749550998210907,
"learning_rate": 0.0001405042737339524,
"loss": 0.1457,
"mean_token_accuracy": 0.9627916514873505,
"num_tokens": 1906200.0,
"step": 92
},
{
"epoch": 1.178343949044586,
"grad_norm": 0.16051284968852997,
"learning_rate": 0.0001392294495172681,
"loss": 0.1138,
"mean_token_accuracy": 0.9708078503608704,
"num_tokens": 1929089.0,
"step": 93
},
{
"epoch": 1.1910828025477707,
"grad_norm": 0.1582704484462738,
"learning_rate": 0.00013794704497101655,
"loss": 0.1393,
"mean_token_accuracy": 0.9625002443790436,
"num_tokens": 1950436.0,
"step": 94
},
{
"epoch": 1.2038216560509554,
"grad_norm": 0.19418908655643463,
"learning_rate": 0.0001366573078949813,
"loss": 0.1484,
"mean_token_accuracy": 0.9607403576374054,
"num_tokens": 1970259.0,
"step": 95
},
{
"epoch": 1.21656050955414,
"grad_norm": 0.1565779149532318,
"learning_rate": 0.00013536048750581494,
"loss": 0.1133,
"mean_token_accuracy": 0.9693767130374908,
"num_tokens": 1990966.0,
"step": 96
},
{
"epoch": 1.2292993630573248,
"grad_norm": 0.1751173734664917,
"learning_rate": 0.00013405683438888282,
"loss": 0.1543,
"mean_token_accuracy": 0.9605205059051514,
"num_tokens": 2011687.0,
"step": 97
},
{
"epoch": 1.2420382165605095,
"grad_norm": 0.1851140260696411,
"learning_rate": 0.00013274660044984224,
"loss": 0.1569,
"mean_token_accuracy": 0.9579177796840668,
"num_tokens": 2032850.0,
"step": 98
},
{
"epoch": 1.2547770700636942,
"grad_norm": 0.17630673944950104,
"learning_rate": 0.00013143003886596669,
"loss": 0.1201,
"mean_token_accuracy": 0.9683541655540466,
"num_tokens": 2054502.0,
"step": 99
},
{
"epoch": 1.267515923566879,
"grad_norm": 0.19014202058315277,
"learning_rate": 0.0001301074040372242,
"loss": 0.1292,
"mean_token_accuracy": 0.9665453433990479,
"num_tokens": 2075517.0,
"step": 100
},
{
"epoch": 1.2802547770700636,
"grad_norm": 0.162857323884964,
"learning_rate": 0.00012877895153711935,
"loss": 0.1065,
"mean_token_accuracy": 0.9714101850986481,
"num_tokens": 2095734.0,
"step": 101
},
{
"epoch": 1.2929936305732483,
"grad_norm": 0.16616225242614746,
"learning_rate": 0.0001274449380633089,
"loss": 0.116,
"mean_token_accuracy": 0.9681942164897919,
"num_tokens": 2117916.0,
"step": 102
},
{
"epoch": 1.305732484076433,
"grad_norm": 0.1441652923822403,
"learning_rate": 0.00012610562138799978,
"loss": 0.1242,
"mean_token_accuracy": 0.9661942422389984,
"num_tokens": 2137533.0,
"step": 103
},
{
"epoch": 1.3184713375796178,
"grad_norm": 0.15105916559696198,
"learning_rate": 0.00012476126030813963,
"loss": 0.1106,
"mean_token_accuracy": 0.9702428579330444,
"num_tokens": 2156908.0,
"step": 104
},
{
"epoch": 1.3312101910828025,
"grad_norm": 0.16298384964466095,
"learning_rate": 0.0001234121145954094,
"loss": 0.1118,
"mean_token_accuracy": 0.9696470499038696,
"num_tokens": 2178701.0,
"step": 105
},
{
"epoch": 1.3439490445859872,
"grad_norm": 0.17056092619895935,
"learning_rate": 0.0001220584449460274,
"loss": 0.1255,
"mean_token_accuracy": 0.9645788669586182,
"num_tokens": 2200357.0,
"step": 106
},
{
"epoch": 1.356687898089172,
"grad_norm": 0.1652529537677765,
"learning_rate": 0.00012070051293037492,
"loss": 0.121,
"mean_token_accuracy": 0.967876136302948,
"num_tokens": 2222840.0,
"step": 107
},
{
"epoch": 1.3694267515923566,
"grad_norm": 0.19024129211902618,
"learning_rate": 0.00011933858094245281,
"loss": 0.1181,
"mean_token_accuracy": 0.9682499766349792,
"num_tokens": 2245153.0,
"step": 108
},
{
"epoch": 1.3821656050955413,
"grad_norm": 0.1724906712770462,
"learning_rate": 0.00011797291214917881,
"loss": 0.11,
"mean_token_accuracy": 0.9716835618019104,
"num_tokens": 2265787.0,
"step": 109
},
{
"epoch": 1.394904458598726,
"grad_norm": 0.12500053644180298,
"learning_rate": 0.00011660377043953588,
"loss": 0.1227,
"mean_token_accuracy": 0.9684112370014191,
"num_tokens": 2288666.0,
"step": 110
},
{
"epoch": 1.4076433121019107,
"grad_norm": 0.17808276414871216,
"learning_rate": 0.0001152314203735805,
"loss": 0.1201,
"mean_token_accuracy": 0.9669378101825714,
"num_tokens": 2309284.0,
"step": 111
},
{
"epoch": 1.4203821656050954,
"grad_norm": 0.1402737945318222,
"learning_rate": 0.0001138561271313219,
"loss": 0.1111,
"mean_token_accuracy": 0.9715414047241211,
"num_tokens": 2331578.0,
"step": 112
},
{
"epoch": 1.4331210191082802,
"grad_norm": 0.15381915867328644,
"learning_rate": 0.00011247815646148087,
"loss": 0.1217,
"mean_token_accuracy": 0.9678640961647034,
"num_tokens": 2350038.0,
"step": 113
},
{
"epoch": 1.4458598726114649,
"grad_norm": 0.14706242084503174,
"learning_rate": 0.00011109777463013915,
"loss": 0.1061,
"mean_token_accuracy": 0.9708584249019623,
"num_tokens": 2368964.0,
"step": 114
},
{
"epoch": 1.4585987261146496,
"grad_norm": 0.15973958373069763,
"learning_rate": 0.0001097152483692886,
"loss": 0.1197,
"mean_token_accuracy": 0.9688680768013,
"num_tokens": 2391178.0,
"step": 115
},
{
"epoch": 1.4713375796178343,
"grad_norm": 0.1674444079399109,
"learning_rate": 0.00010833084482529048,
"loss": 0.1093,
"mean_token_accuracy": 0.9704143404960632,
"num_tokens": 2412996.0,
"step": 116
},
{
"epoch": 1.484076433121019,
"grad_norm": 0.16148361563682556,
"learning_rate": 0.00010694483150725458,
"loss": 0.117,
"mean_token_accuracy": 0.9665324985980988,
"num_tokens": 2434259.0,
"step": 117
},
{
"epoch": 1.4968152866242037,
"grad_norm": 0.16595368087291718,
"learning_rate": 0.00010555747623534831,
"loss": 0.1406,
"mean_token_accuracy": 0.9625270962715149,
"num_tokens": 2455587.0,
"step": 118
},
{
"epoch": 1.5095541401273884,
"grad_norm": 0.16053670644760132,
"learning_rate": 0.00010416904708904548,
"loss": 0.1256,
"mean_token_accuracy": 0.9664609730243683,
"num_tokens": 2476283.0,
"step": 119
},
{
"epoch": 1.5222929936305731,
"grad_norm": 0.20048527419567108,
"learning_rate": 0.00010277981235532541,
"loss": 0.1254,
"mean_token_accuracy": 0.9659788012504578,
"num_tokens": 2497546.0,
"step": 120
},
{
"epoch": 1.5350318471337578,
"grad_norm": 0.16457313299179077,
"learning_rate": 0.00010139004047683151,
"loss": 0.1229,
"mean_token_accuracy": 0.9671443700790405,
"num_tokens": 2518296.0,
"step": 121
},
{
"epoch": 1.5477707006369426,
"grad_norm": 0.15524955093860626,
"learning_rate": 0.0001,
"loss": 0.1033,
"mean_token_accuracy": 0.9726420640945435,
"num_tokens": 2540213.0,
"step": 122
},
{
"epoch": 1.5605095541401273,
"grad_norm": 0.13140025734901428,
"learning_rate": 9.860995952316851e-05,
"loss": 0.1183,
"mean_token_accuracy": 0.968624621629715,
"num_tokens": 2559617.0,
"step": 123
},
{
"epoch": 1.573248407643312,
"grad_norm": 0.14936192333698273,
"learning_rate": 9.722018764467461e-05,
"loss": 0.0999,
"mean_token_accuracy": 0.9732542335987091,
"num_tokens": 2582565.0,
"step": 124
},
{
"epoch": 1.5859872611464967,
"grad_norm": 0.15049338340759277,
"learning_rate": 9.583095291095453e-05,
"loss": 0.1194,
"mean_token_accuracy": 0.9678354859352112,
"num_tokens": 2602091.0,
"step": 125
},
{
"epoch": 1.5987261146496814,
"grad_norm": 0.16037316620349884,
"learning_rate": 9.444252376465171e-05,
"loss": 0.1218,
"mean_token_accuracy": 0.9661269187927246,
"num_tokens": 2621569.0,
"step": 126
},
{
"epoch": 1.611464968152866,
"grad_norm": 0.14958986639976501,
"learning_rate": 9.305516849274541e-05,
"loss": 0.1186,
"mean_token_accuracy": 0.9682396650314331,
"num_tokens": 2642561.0,
"step": 127
},
{
"epoch": 1.6242038216560508,
"grad_norm": 0.13898329436779022,
"learning_rate": 9.166915517470953e-05,
"loss": 0.0917,
"mean_token_accuracy": 0.974632978439331,
"num_tokens": 2664635.0,
"step": 128
},
{
"epoch": 1.6369426751592355,
"grad_norm": 0.15911662578582764,
"learning_rate": 9.028475163071141e-05,
"loss": 0.1275,
"mean_token_accuracy": 0.9655503630638123,
"num_tokens": 2685293.0,
"step": 129
},
{
"epoch": 1.6496815286624202,
"grad_norm": 0.1641586571931839,
"learning_rate": 8.890222536986085e-05,
"loss": 0.1326,
"mean_token_accuracy": 0.9644103944301605,
"num_tokens": 2706288.0,
"step": 130
},
{
"epoch": 1.662420382165605,
"grad_norm": 0.17261752486228943,
"learning_rate": 8.752184353851916e-05,
"loss": 0.1263,
"mean_token_accuracy": 0.9659662842750549,
"num_tokens": 2729317.0,
"step": 131
},
{
"epoch": 1.6751592356687897,
"grad_norm": 0.18082129955291748,
"learning_rate": 8.614387286867814e-05,
"loss": 0.1431,
"mean_token_accuracy": 0.9621657431125641,
"num_tokens": 2751538.0,
"step": 132
},
{
"epoch": 1.6878980891719744,
"grad_norm": 0.16913549602031708,
"learning_rate": 8.47685796264195e-05,
"loss": 0.113,
"mean_token_accuracy": 0.9688459932804108,
"num_tokens": 2771471.0,
"step": 133
},
{
"epoch": 1.700636942675159,
"grad_norm": 0.17692820727825165,
"learning_rate": 8.339622956046417e-05,
"loss": 0.1163,
"mean_token_accuracy": 0.9676001965999603,
"num_tokens": 2791343.0,
"step": 134
},
{
"epoch": 1.7133757961783438,
"grad_norm": 0.14758412539958954,
"learning_rate": 8.202708785082121e-05,
"loss": 0.1528,
"mean_token_accuracy": 0.9607497751712799,
"num_tokens": 2810844.0,
"step": 135
},
{
"epoch": 1.7261146496815285,
"grad_norm": 0.2107594609260559,
"learning_rate": 8.066141905754723e-05,
"loss": 0.1232,
"mean_token_accuracy": 0.9672644436359406,
"num_tokens": 2831746.0,
"step": 136
},
{
"epoch": 1.7388535031847132,
"grad_norm": 0.14881309866905212,
"learning_rate": 7.929948706962508e-05,
"loss": 0.1045,
"mean_token_accuracy": 0.971291571855545,
"num_tokens": 2853450.0,
"step": 137
},
{
"epoch": 1.7515923566878981,
"grad_norm": 0.17492781579494476,
"learning_rate": 7.794155505397261e-05,
"loss": 0.1216,
"mean_token_accuracy": 0.9665966033935547,
"num_tokens": 2873410.0,
"step": 138
},
{
"epoch": 1.7643312101910829,
"grad_norm": 0.15295670926570892,
"learning_rate": 7.658788540459062e-05,
"loss": 0.0897,
"mean_token_accuracy": 0.9743934571743011,
"num_tokens": 2894318.0,
"step": 139
},
{
"epoch": 1.7770700636942676,
"grad_norm": 0.12950226664543152,
"learning_rate": 7.523873969186039e-05,
"loss": 0.1119,
"mean_token_accuracy": 0.9689730405807495,
"num_tokens": 2912886.0,
"step": 140
},
{
"epoch": 1.7898089171974523,
"grad_norm": 0.1793074905872345,
"learning_rate": 7.389437861200024e-05,
"loss": 0.1131,
"mean_token_accuracy": 0.9701094329357147,
"num_tokens": 2932155.0,
"step": 141
},
{
"epoch": 1.802547770700637,
"grad_norm": 0.1540454626083374,
"learning_rate": 7.25550619366911e-05,
"loss": 0.1142,
"mean_token_accuracy": 0.969739556312561,
"num_tokens": 2954884.0,
"step": 142
},
{
"epoch": 1.8152866242038217,
"grad_norm": 0.15937185287475586,
"learning_rate": 7.122104846288064e-05,
"loss": 0.128,
"mean_token_accuracy": 0.9650757312774658,
"num_tokens": 2976191.0,
"step": 143
},
{
"epoch": 1.8280254777070064,
"grad_norm": 0.15609461069107056,
"learning_rate": 6.989259596277582e-05,
"loss": 0.0999,
"mean_token_accuracy": 0.9722784161567688,
"num_tokens": 2996633.0,
"step": 144
},
{
"epoch": 1.8407643312101911,
"grad_norm": 0.1675417721271515,
"learning_rate": 6.85699611340333e-05,
"loss": 0.1058,
"mean_token_accuracy": 0.9703787863254547,
"num_tokens": 3017723.0,
"step": 145
},
{
"epoch": 1.8535031847133758,
"grad_norm": 0.19539587199687958,
"learning_rate": 6.725339955015777e-05,
"loss": 0.1354,
"mean_token_accuracy": 0.96318119764328,
"num_tokens": 3037762.0,
"step": 146
},
{
"epoch": 1.8662420382165605,
"grad_norm": 0.13168184459209442,
"learning_rate": 6.594316561111724e-05,
"loss": 0.1005,
"mean_token_accuracy": 0.9725645482540131,
"num_tokens": 3058329.0,
"step": 147
},
{
"epoch": 1.8789808917197452,
"grad_norm": 0.1617504358291626,
"learning_rate": 6.46395124941851e-05,
"loss": 0.136,
"mean_token_accuracy": 0.9640224277973175,
"num_tokens": 3079340.0,
"step": 148
},
{
"epoch": 1.89171974522293,
"grad_norm": 0.16531525552272797,
"learning_rate": 6.334269210501875e-05,
"loss": 0.1195,
"mean_token_accuracy": 0.9680073857307434,
"num_tokens": 3099670.0,
"step": 149
},
{
"epoch": 1.9044585987261147,
"grad_norm": 0.22178637981414795,
"learning_rate": 6.205295502898348e-05,
"loss": 0.1281,
"mean_token_accuracy": 0.9676016867160797,
"num_tokens": 3119491.0,
"step": 150
},
{
"epoch": 1.9171974522292994,
"grad_norm": 0.18001458048820496,
"learning_rate": 6.0770550482731924e-05,
"loss": 0.1079,
"mean_token_accuracy": 0.9712074995040894,
"num_tokens": 3139513.0,
"step": 151
},
{
"epoch": 1.929936305732484,
"grad_norm": 0.1498527079820633,
"learning_rate": 5.9495726266047605e-05,
"loss": 0.1042,
"mean_token_accuracy": 0.9726397097110748,
"num_tokens": 3160672.0,
"step": 152
},
{
"epoch": 1.9426751592356688,
"grad_norm": 0.1454562097787857,
"learning_rate": 5.8228728713962543e-05,
"loss": 0.1103,
"mean_token_accuracy": 0.9712657034397125,
"num_tokens": 3182484.0,
"step": 153
},
{
"epoch": 1.9554140127388535,
"grad_norm": 0.19215665757656097,
"learning_rate": 5.696980264915777e-05,
"loss": 0.0922,
"mean_token_accuracy": 0.9748160243034363,
"num_tokens": 3203367.0,
"step": 154
},
{
"epoch": 1.9681528662420382,
"grad_norm": 0.14836356043815613,
"learning_rate": 5.571919133465605e-05,
"loss": 0.1049,
"mean_token_accuracy": 0.9711067080497742,
"num_tokens": 3225455.0,
"step": 155
},
{
"epoch": 1.980891719745223,
"grad_norm": 0.1734013706445694,
"learning_rate": 5.447713642681612e-05,
"loss": 0.1062,
"mean_token_accuracy": 0.9732925593852997,
"num_tokens": 3246222.0,
"step": 156
},
{
"epoch": 1.9936305732484076,
"grad_norm": 0.13410215079784393,
"learning_rate": 5.324387792863719e-05,
"loss": 0.1118,
"mean_token_accuracy": 0.9705207347869873,
"num_tokens": 3268819.0,
"step": 157
},
{
"epoch": 2.0,
"grad_norm": 0.19894972443580627,
"learning_rate": 5.201965414338308e-05,
"loss": 0.0804,
"mean_token_accuracy": 0.9756550192832947,
"num_tokens": 3278011.0,
"step": 158
},
{
"epoch": 2.0127388535031847,
"grad_norm": 0.13745059072971344,
"learning_rate": 5.080470162853472e-05,
"loss": 0.0994,
"mean_token_accuracy": 0.9729433953762054,
"num_tokens": 3299349.0,
"step": 159
},
{
"epoch": 2.0254777070063694,
"grad_norm": 0.1536296308040619,
"learning_rate": 4.959925515008002e-05,
"loss": 0.0976,
"mean_token_accuracy": 0.973717212677002,
"num_tokens": 3319814.0,
"step": 160
},
{
"epoch": 2.038216560509554,
"grad_norm": 0.14658384025096893,
"learning_rate": 4.840354763714991e-05,
"loss": 0.0966,
"mean_token_accuracy": 0.9740248918533325,
"num_tokens": 3341791.0,
"step": 161
},
{
"epoch": 2.050955414012739,
"grad_norm": 0.12013503909111023,
"learning_rate": 4.7217810137009274e-05,
"loss": 0.0783,
"mean_token_accuracy": 0.9775272607803345,
"num_tokens": 3362482.0,
"step": 162
},
{
"epoch": 2.0636942675159236,
"grad_norm": 0.13740386068820953,
"learning_rate": 4.604227177041156e-05,
"loss": 0.0829,
"mean_token_accuracy": 0.9774322211742401,
"num_tokens": 3383265.0,
"step": 163
},
{
"epoch": 2.0764331210191083,
"grad_norm": 0.1289196014404297,
"learning_rate": 4.487715968732568e-05,
"loss": 0.073,
"mean_token_accuracy": 0.9784163534641266,
"num_tokens": 3405772.0,
"step": 164
},
{
"epoch": 2.089171974522293,
"grad_norm": 0.1675165295600891,
"learning_rate": 4.372269902304363e-05,
"loss": 0.0875,
"mean_token_accuracy": 0.9745315313339233,
"num_tokens": 3426008.0,
"step": 165
},
{
"epoch": 2.1019108280254777,
"grad_norm": 0.16612502932548523,
"learning_rate": 4.257911285467754e-05,
"loss": 0.0861,
"mean_token_accuracy": 0.9750963449478149,
"num_tokens": 3445583.0,
"step": 166
},
{
"epoch": 2.1146496815286624,
"grad_norm": 0.24531899392604828,
"learning_rate": 4.144662215805426e-05,
"loss": 0.0845,
"mean_token_accuracy": 0.9756963849067688,
"num_tokens": 3465685.0,
"step": 167
},
{
"epoch": 2.127388535031847,
"grad_norm": 0.165582075715065,
"learning_rate": 4.0325445765016145e-05,
"loss": 0.0798,
"mean_token_accuracy": 0.9772799611091614,
"num_tokens": 3486747.0,
"step": 168
},
{
"epoch": 2.140127388535032,
"grad_norm": 0.20452290773391724,
"learning_rate": 3.921580032113602e-05,
"loss": 0.1093,
"mean_token_accuracy": 0.9696950614452362,
"num_tokens": 3507170.0,
"step": 169
},
{
"epoch": 2.1528662420382165,
"grad_norm": 0.22140122950077057,
"learning_rate": 3.8117900243854595e-05,
"loss": 0.0932,
"mean_token_accuracy": 0.9731378257274628,
"num_tokens": 3528688.0,
"step": 170
},
{
"epoch": 2.1656050955414012,
"grad_norm": 0.14823046326637268,
"learning_rate": 3.7031957681048604e-05,
"loss": 0.0787,
"mean_token_accuracy": 0.978544145822525,
"num_tokens": 3551493.0,
"step": 171
},
{
"epoch": 2.178343949044586,
"grad_norm": 0.18386752903461456,
"learning_rate": 3.595818247003713e-05,
"loss": 0.0911,
"mean_token_accuracy": 0.9754537045955658,
"num_tokens": 3573241.0,
"step": 172
},
{
"epoch": 2.1910828025477707,
"grad_norm": 0.14411669969558716,
"learning_rate": 3.489678209703475e-05,
"loss": 0.0791,
"mean_token_accuracy": 0.9779654443264008,
"num_tokens": 3592020.0,
"step": 173
},
{
"epoch": 2.2038216560509554,
"grad_norm": 0.1390937715768814,
"learning_rate": 3.3847961657058845e-05,
"loss": 0.0773,
"mean_token_accuracy": 0.9773176610469818,
"num_tokens": 3612923.0,
"step": 174
},
{
"epoch": 2.21656050955414,
"grad_norm": 0.1446724385023117,
"learning_rate": 3.281192381429894e-05,
"loss": 0.0792,
"mean_token_accuracy": 0.9771729111671448,
"num_tokens": 3633033.0,
"step": 175
},
{
"epoch": 2.229299363057325,
"grad_norm": 0.1646534949541092,
"learning_rate": 3.178886876295578e-05,
"loss": 0.0856,
"mean_token_accuracy": 0.976368248462677,
"num_tokens": 3653549.0,
"step": 176
},
{
"epoch": 2.2420382165605095,
"grad_norm": 0.14741237461566925,
"learning_rate": 3.077899418855772e-05,
"loss": 0.0725,
"mean_token_accuracy": 0.9795258343219757,
"num_tokens": 3676404.0,
"step": 177
},
{
"epoch": 2.254777070063694,
"grad_norm": 0.12899887561798096,
"learning_rate": 2.9782495229761808e-05,
"loss": 0.0695,
"mean_token_accuracy": 0.9794414341449738,
"num_tokens": 3696514.0,
"step": 178
},
{
"epoch": 2.267515923566879,
"grad_norm": 0.1296052187681198,
"learning_rate": 2.879956444064703e-05,
"loss": 0.07,
"mean_token_accuracy": 0.9783405065536499,
"num_tokens": 3716614.0,
"step": 179
},
{
"epoch": 2.2802547770700636,
"grad_norm": 0.17682477831840515,
"learning_rate": 2.783039175350699e-05,
"loss": 0.0899,
"mean_token_accuracy": 0.9737552106380463,
"num_tokens": 3734545.0,
"step": 180
},
{
"epoch": 2.2929936305732483,
"grad_norm": 0.150472953915596,
"learning_rate": 2.6875164442149147e-05,
"loss": 0.0767,
"mean_token_accuracy": 0.9762512743473053,
"num_tokens": 3755770.0,
"step": 181
},
{
"epoch": 2.305732484076433,
"grad_norm": 0.1425381898880005,
"learning_rate": 2.5934067085707834e-05,
"loss": 0.0741,
"mean_token_accuracy": 0.9798364341259003,
"num_tokens": 3778378.0,
"step": 182
},
{
"epoch": 2.3184713375796178,
"grad_norm": 0.13129480183124542,
"learning_rate": 2.500728153297788e-05,
"loss": 0.0736,
"mean_token_accuracy": 0.9784353077411652,
"num_tokens": 3799187.0,
"step": 183
},
{
"epoch": 2.3312101910828025,
"grad_norm": 0.1579660028219223,
"learning_rate": 2.409498686727587e-05,
"loss": 0.0839,
"mean_token_accuracy": 0.9769056141376495,
"num_tokens": 3821803.0,
"step": 184
},
{
"epoch": 2.343949044585987,
"grad_norm": 0.13841375708580017,
"learning_rate": 2.3197359371835802e-05,
"loss": 0.0729,
"mean_token_accuracy": 0.9776602387428284,
"num_tokens": 3842009.0,
"step": 185
},
{
"epoch": 2.356687898089172,
"grad_norm": 0.14079244434833527,
"learning_rate": 2.2314572495745746e-05,
"loss": 0.0745,
"mean_token_accuracy": 0.978991687297821,
"num_tokens": 3861386.0,
"step": 186
},
{
"epoch": 2.3694267515923566,
"grad_norm": 0.1590651422739029,
"learning_rate": 2.1446796820432167e-05,
"loss": 0.0782,
"mean_token_accuracy": 0.9771281480789185,
"num_tokens": 3880797.0,
"step": 187
},
{
"epoch": 2.3821656050955413,
"grad_norm": 0.143194317817688,
"learning_rate": 2.0594200026698363e-05,
"loss": 0.0818,
"mean_token_accuracy": 0.9773141145706177,
"num_tokens": 3903019.0,
"step": 188
},
{
"epoch": 2.394904458598726,
"grad_norm": 0.13460594415664673,
"learning_rate": 1.9756946862323535e-05,
"loss": 0.0721,
"mean_token_accuracy": 0.97975093126297,
"num_tokens": 3924784.0,
"step": 189
},
{
"epoch": 2.4076433121019107,
"grad_norm": 0.13424114882946014,
"learning_rate": 1.8935199110228275e-05,
"loss": 0.0734,
"mean_token_accuracy": 0.9811668992042542,
"num_tokens": 3948108.0,
"step": 190
},
{
"epoch": 2.4203821656050954,
"grad_norm": 0.17168937623500824,
"learning_rate": 1.8129115557213262e-05,
"loss": 0.0785,
"mean_token_accuracy": 0.9771130979061127,
"num_tokens": 3969333.0,
"step": 191
},
{
"epoch": 2.43312101910828,
"grad_norm": 0.13767112791538239,
"learning_rate": 1.7338851963276825e-05,
"loss": 0.0736,
"mean_token_accuracy": 0.9778575003147125,
"num_tokens": 3989403.0,
"step": 192
},
{
"epoch": 2.445859872611465,
"grad_norm": 0.18789297342300415,
"learning_rate": 1.656456103151728e-05,
"loss": 0.0924,
"mean_token_accuracy": 0.9723543524742126,
"num_tokens": 4010821.0,
"step": 193
},
{
"epoch": 2.4585987261146496,
"grad_norm": 0.1507100760936737,
"learning_rate": 1.580639237862608e-05,
"loss": 0.0764,
"mean_token_accuracy": 0.97721067070961,
"num_tokens": 4030537.0,
"step": 194
},
{
"epoch": 2.4713375796178343,
"grad_norm": 0.18637511134147644,
"learning_rate": 1.5064492505977234e-05,
"loss": 0.0784,
"mean_token_accuracy": 0.9756501317024231,
"num_tokens": 4048731.0,
"step": 195
},
{
"epoch": 2.484076433121019,
"grad_norm": 0.17008532583713531,
"learning_rate": 1.433900477131882e-05,
"loss": 0.0804,
"mean_token_accuracy": 0.9770023822784424,
"num_tokens": 4068414.0,
"step": 196
},
{
"epoch": 2.4968152866242037,
"grad_norm": 0.14089594781398773,
"learning_rate": 1.363006936107183e-05,
"loss": 0.0666,
"mean_token_accuracy": 0.9802176356315613,
"num_tokens": 4089906.0,
"step": 197
},
{
"epoch": 2.5095541401273884,
"grad_norm": 0.1633421629667282,
"learning_rate": 1.29378232632419e-05,
"loss": 0.078,
"mean_token_accuracy": 0.9769896566867828,
"num_tokens": 4110825.0,
"step": 198
},
{
"epoch": 2.522292993630573,
"grad_norm": 0.148310124874115,
"learning_rate": 1.2262400240949023e-05,
"loss": 0.0866,
"mean_token_accuracy": 0.9763473868370056,
"num_tokens": 4130116.0,
"step": 199
},
{
"epoch": 2.535031847133758,
"grad_norm": 0.14359574019908905,
"learning_rate": 1.1603930806580444e-05,
"loss": 0.0744,
"mean_token_accuracy": 0.9773200452327728,
"num_tokens": 4151296.0,
"step": 200
},
{
"epoch": 2.5477707006369426,
"grad_norm": 0.15275435149669647,
"learning_rate": 1.0962542196571634e-05,
"loss": 0.0783,
"mean_token_accuracy": 0.9785310328006744,
"num_tokens": 4172098.0,
"step": 201
},
{
"epoch": 2.5605095541401273,
"grad_norm": 0.16805951297283173,
"learning_rate": 1.0338358346820353e-05,
"loss": 0.0837,
"mean_token_accuracy": 0.9770323634147644,
"num_tokens": 4193109.0,
"step": 202
},
{
"epoch": 2.573248407643312,
"grad_norm": 0.14101877808570862,
"learning_rate": 9.731499868738447e-06,
"loss": 0.0763,
"mean_token_accuracy": 0.9785304367542267,
"num_tokens": 4215347.0,
"step": 203
},
{
"epoch": 2.5859872611464967,
"grad_norm": 0.15893617272377014,
"learning_rate": 9.142084025945984e-06,
"loss": 0.0772,
"mean_token_accuracy": 0.978299617767334,
"num_tokens": 4236346.0,
"step": 204
},
{
"epoch": 2.5987261146496814,
"grad_norm": 0.14236551523208618,
"learning_rate": 8.570224711612385e-06,
"loss": 0.0715,
"mean_token_accuracy": 0.9786622226238251,
"num_tokens": 4258638.0,
"step": 205
},
{
"epoch": 2.611464968152866,
"grad_norm": 0.17728912830352783,
"learning_rate": 8.016032426448817e-06,
"loss": 0.0855,
"mean_token_accuracy": 0.9760014414787292,
"num_tokens": 4279271.0,
"step": 206
},
{
"epoch": 2.624203821656051,
"grad_norm": 0.19720520079135895,
"learning_rate": 7.479614257355971e-06,
"loss": 0.0833,
"mean_token_accuracy": 0.9759804606437683,
"num_tokens": 4299151.0,
"step": 207
},
{
"epoch": 2.6369426751592355,
"grad_norm": 0.14556831121444702,
"learning_rate": 6.961073856731648e-06,
"loss": 0.0737,
"mean_token_accuracy": 0.9779518842697144,
"num_tokens": 4320704.0,
"step": 208
},
{
"epoch": 2.6496815286624202,
"grad_norm": 0.16077663004398346,
"learning_rate": 6.460511422441984e-06,
"loss": 0.0794,
"mean_token_accuracy": 0.9782223701477051,
"num_tokens": 4339704.0,
"step": 209
},
{
"epoch": 2.662420382165605,
"grad_norm": 0.15406979620456696,
"learning_rate": 5.978023678460099e-06,
"loss": 0.0776,
"mean_token_accuracy": 0.977834552526474,
"num_tokens": 4359021.0,
"step": 210
},
{
"epoch": 2.6751592356687897,
"grad_norm": 0.16407983005046844,
"learning_rate": 5.5137038561761115e-06,
"loss": 0.0837,
"mean_token_accuracy": 0.9751948714256287,
"num_tokens": 4379725.0,
"step": 211
},
{
"epoch": 2.6878980891719744,
"grad_norm": 0.13812731206417084,
"learning_rate": 5.067641676381918e-06,
"loss": 0.0718,
"mean_token_accuracy": 0.977728933095932,
"num_tokens": 4402644.0,
"step": 212
},
{
"epoch": 2.700636942675159,
"grad_norm": 0.16759884357452393,
"learning_rate": 4.639923331934471e-06,
"loss": 0.077,
"mean_token_accuracy": 0.9772835969924927,
"num_tokens": 4423503.0,
"step": 213
},
{
"epoch": 2.713375796178344,
"grad_norm": 0.1482495367527008,
"learning_rate": 4.230631471100655e-06,
"loss": 0.0783,
"mean_token_accuracy": 0.9765441417694092,
"num_tokens": 4445353.0,
"step": 214
},
{
"epoch": 2.7261146496815285,
"grad_norm": 0.1537255495786667,
"learning_rate": 3.839845181587098e-06,
"loss": 0.0845,
"mean_token_accuracy": 0.9765470325946808,
"num_tokens": 4467140.0,
"step": 215
},
{
"epoch": 2.738853503184713,
"grad_norm": 0.19450800120830536,
"learning_rate": 3.467639975257997e-06,
"loss": 0.0907,
"mean_token_accuracy": 0.9742664694786072,
"num_tokens": 4486775.0,
"step": 216
},
{
"epoch": 2.7515923566878984,
"grad_norm": 0.16700267791748047,
"learning_rate": 3.1140877735439387e-06,
"loss": 0.0825,
"mean_token_accuracy": 0.976231724023819,
"num_tokens": 4507937.0,
"step": 217
},
{
"epoch": 2.7643312101910826,
"grad_norm": 0.1603633612394333,
"learning_rate": 2.7792568935444796e-06,
"loss": 0.0823,
"mean_token_accuracy": 0.976065456867218,
"num_tokens": 4527826.0,
"step": 218
},
{
"epoch": 2.777070063694268,
"grad_norm": 0.14653527736663818,
"learning_rate": 2.4632120348272003e-06,
"loss": 0.0775,
"mean_token_accuracy": 0.9774307906627655,
"num_tokens": 4550667.0,
"step": 219
},
{
"epoch": 2.789808917197452,
"grad_norm": 0.15313751995563507,
"learning_rate": 2.166014266925731e-06,
"loss": 0.0819,
"mean_token_accuracy": 0.9767453074455261,
"num_tokens": 4570173.0,
"step": 220
},
{
"epoch": 2.802547770700637,
"grad_norm": 0.13249285519123077,
"learning_rate": 1.88772101753929e-06,
"loss": 0.0741,
"mean_token_accuracy": 0.9789757132530212,
"num_tokens": 4590375.0,
"step": 221
},
{
"epoch": 2.8152866242038215,
"grad_norm": 0.14562749862670898,
"learning_rate": 1.6283860614358936e-06,
"loss": 0.0825,
"mean_token_accuracy": 0.9768469035625458,
"num_tokens": 4611934.0,
"step": 222
},
{
"epoch": 2.8280254777070066,
"grad_norm": 0.15164901316165924,
"learning_rate": 1.3880595100613792e-06,
"loss": 0.076,
"mean_token_accuracy": 0.9793215095996857,
"num_tokens": 4634831.0,
"step": 223
},
{
"epoch": 2.840764331210191,
"grad_norm": 0.14515450596809387,
"learning_rate": 1.1667878018564171e-06,
"loss": 0.0759,
"mean_token_accuracy": 0.9793158173561096,
"num_tokens": 4654825.0,
"step": 224
},
{
"epoch": 2.853503184713376,
"grad_norm": 0.15432044863700867,
"learning_rate": 9.64613693283123e-07,
"loss": 0.0779,
"mean_token_accuracy": 0.9766505062580109,
"num_tokens": 4676000.0,
"step": 225
},
{
"epoch": 2.8662420382165603,
"grad_norm": 0.1555798053741455,
"learning_rate": 7.815762505632096e-07,
"loss": 0.0799,
"mean_token_accuracy": 0.9778449833393097,
"num_tokens": 4695897.0,
"step": 226
},
{
"epoch": 2.8789808917197455,
"grad_norm": 0.16175790131092072,
"learning_rate": 6.177108421292266e-07,
"loss": 0.086,
"mean_token_accuracy": 0.9760761559009552,
"num_tokens": 4716551.0,
"step": 227
},
{
"epoch": 2.8917197452229297,
"grad_norm": 0.13542035222053528,
"learning_rate": 4.7304913179025965e-07,
"loss": 0.0734,
"mean_token_accuracy": 0.979287177324295,
"num_tokens": 4739406.0,
"step": 228
},
{
"epoch": 2.904458598726115,
"grad_norm": 0.1451287418603897,
"learning_rate": 3.4761907261356976e-07,
"loss": 0.0777,
"mean_token_accuracy": 0.977697491645813,
"num_tokens": 4760092.0,
"step": 229
},
{
"epoch": 2.917197452229299,
"grad_norm": 0.1680404543876648,
"learning_rate": 2.414449015231357e-07,
"loss": 0.0934,
"mean_token_accuracy": 0.973942905664444,
"num_tokens": 4780982.0,
"step": 230
},
{
"epoch": 2.9299363057324843,
"grad_norm": 0.19171962141990662,
"learning_rate": 1.545471346164007e-07,
"loss": 0.0939,
"mean_token_accuracy": 0.9738248884677887,
"num_tokens": 4801657.0,
"step": 231
},
{
"epoch": 2.9426751592356686,
"grad_norm": 0.14699915051460266,
"learning_rate": 8.694256319987659e-08,
"loss": 0.0793,
"mean_token_accuracy": 0.9780023992061615,
"num_tokens": 4821928.0,
"step": 232
},
{
"epoch": 2.9554140127388537,
"grad_norm": 0.15162605047225952,
"learning_rate": 3.8644250544594975e-08,
"loss": 0.0799,
"mean_token_accuracy": 0.9769730567932129,
"num_tokens": 4845265.0,
"step": 233
},
{
"epoch": 2.968152866242038,
"grad_norm": 0.19175927340984344,
"learning_rate": 9.661529361892907e-09,
"loss": 0.086,
"mean_token_accuracy": 0.9761645793914795,
"num_tokens": 4864834.0,
"step": 234
},
{
"epoch": 2.968152866242038,
"step": 234,
"total_flos": 3.895828387117138e+17,
"train_loss": 0.19240072863096866,
"train_runtime": 1091.7173,
"train_samples_per_second": 13.74,
"train_steps_per_second": 0.214
}
],
"logging_steps": 1.0,
"max_steps": 234,
"num_input_tokens_seen": 0,
"num_train_epochs": 3,
"save_steps": 100,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": true
},
"attributes": {}
}
},
"total_flos": 3.895828387117138e+17,
"train_batch_size": 8,
"trial_name": null,
"trial_params": null
}