LLM-continual-learning / trace /seq /order8 /trainer_state.json
YeMoKoo's picture
Add final checkpoint: trace_seq_order8
cba1720 verified
Raw
History Blame Contribute Delete
139 kB
{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 6.917197452229299,
"eval_steps": 500,
"global_step": 546,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.012738853503184714,
"grad_norm": 2.043114423751831,
"learning_rate": 0.0,
"loss": 2.5378,
"mean_token_accuracy": 0.5474915206432343,
"num_tokens": 45860.0,
"step": 1
},
{
"epoch": 0.025477707006369428,
"grad_norm": 1.9945865869522095,
"learning_rate": 1.1764705882352942e-05,
"loss": 2.471,
"mean_token_accuracy": 0.5548032820224762,
"num_tokens": 91607.0,
"step": 2
},
{
"epoch": 0.03821656050955414,
"grad_norm": 1.7864609956741333,
"learning_rate": 2.3529411764705884e-05,
"loss": 2.4891,
"mean_token_accuracy": 0.554142564535141,
"num_tokens": 138803.0,
"step": 3
},
{
"epoch": 0.050955414012738856,
"grad_norm": 1.7019070386886597,
"learning_rate": 3.529411764705883e-05,
"loss": 2.4532,
"mean_token_accuracy": 0.5522601306438446,
"num_tokens": 185711.0,
"step": 4
},
{
"epoch": 0.06369426751592357,
"grad_norm": 1.558175802230835,
"learning_rate": 4.705882352941177e-05,
"loss": 2.3084,
"mean_token_accuracy": 0.5643967390060425,
"num_tokens": 229326.0,
"step": 5
},
{
"epoch": 0.07643312101910828,
"grad_norm": 1.3139784336090088,
"learning_rate": 5.882352941176471e-05,
"loss": 2.1893,
"mean_token_accuracy": 0.5716671049594879,
"num_tokens": 273139.0,
"step": 6
},
{
"epoch": 0.08917197452229299,
"grad_norm": 0.9440768361091614,
"learning_rate": 7.058823529411765e-05,
"loss": 2.0658,
"mean_token_accuracy": 0.5783773064613342,
"num_tokens": 320421.0,
"step": 7
},
{
"epoch": 0.10191082802547771,
"grad_norm": 0.575385332107544,
"learning_rate": 8.23529411764706e-05,
"loss": 1.9971,
"mean_token_accuracy": 0.5801331400871277,
"num_tokens": 368788.0,
"step": 8
},
{
"epoch": 0.11464968152866242,
"grad_norm": 0.9466742277145386,
"learning_rate": 9.411764705882353e-05,
"loss": 1.9893,
"mean_token_accuracy": 0.5827493369579315,
"num_tokens": 415189.0,
"step": 9
},
{
"epoch": 0.12738853503184713,
"grad_norm": 1.1029582023620605,
"learning_rate": 0.00010588235294117647,
"loss": 1.8928,
"mean_token_accuracy": 0.5970898270606995,
"num_tokens": 458774.0,
"step": 10
},
{
"epoch": 0.14012738853503184,
"grad_norm": 0.8789502382278442,
"learning_rate": 0.00011764705882352942,
"loss": 1.9116,
"mean_token_accuracy": 0.5919365584850311,
"num_tokens": 504300.0,
"step": 11
},
{
"epoch": 0.15286624203821655,
"grad_norm": 0.6089919805526733,
"learning_rate": 0.00012941176470588237,
"loss": 1.8636,
"mean_token_accuracy": 0.5960094928741455,
"num_tokens": 550239.0,
"step": 12
},
{
"epoch": 0.16560509554140126,
"grad_norm": 0.567487895488739,
"learning_rate": 0.0001411764705882353,
"loss": 1.849,
"mean_token_accuracy": 0.5990146100521088,
"num_tokens": 595311.0,
"step": 13
},
{
"epoch": 0.17834394904458598,
"grad_norm": 0.45083943009376526,
"learning_rate": 0.00015294117647058822,
"loss": 1.8572,
"mean_token_accuracy": 0.5998204350471497,
"num_tokens": 643731.0,
"step": 14
},
{
"epoch": 0.1910828025477707,
"grad_norm": 0.3835723102092743,
"learning_rate": 0.0001647058823529412,
"loss": 1.8459,
"mean_token_accuracy": 0.6031338572502136,
"num_tokens": 687946.0,
"step": 15
},
{
"epoch": 0.20382165605095542,
"grad_norm": 0.3622026741504669,
"learning_rate": 0.00017647058823529413,
"loss": 1.8221,
"mean_token_accuracy": 0.6063935160636902,
"num_tokens": 733740.0,
"step": 16
},
{
"epoch": 0.21656050955414013,
"grad_norm": 0.3480350971221924,
"learning_rate": 0.00018823529411764707,
"loss": 1.8353,
"mean_token_accuracy": 0.6034441590309143,
"num_tokens": 780185.0,
"step": 17
},
{
"epoch": 0.22929936305732485,
"grad_norm": 0.4176861047744751,
"learning_rate": 0.0002,
"loss": 1.8174,
"mean_token_accuracy": 0.6044492721557617,
"num_tokens": 827533.0,
"step": 18
},
{
"epoch": 0.24203821656050956,
"grad_norm": 0.5879961848258972,
"learning_rate": 0.00019999823657444873,
"loss": 1.8099,
"mean_token_accuracy": 0.6073833703994751,
"num_tokens": 873543.0,
"step": 19
},
{
"epoch": 0.25477707006369427,
"grad_norm": 0.5145211815834045,
"learning_rate": 0.00019999294635998833,
"loss": 1.8359,
"mean_token_accuracy": 0.5988730490207672,
"num_tokens": 923210.0,
"step": 20
},
{
"epoch": 0.267515923566879,
"grad_norm": 0.4540589153766632,
"learning_rate": 0.00019998412954319675,
"loss": 1.7355,
"mean_token_accuracy": 0.618651270866394,
"num_tokens": 969460.0,
"step": 21
},
{
"epoch": 0.2802547770700637,
"grad_norm": 0.3647150993347168,
"learning_rate": 0.00019997178643503004,
"loss": 1.7658,
"mean_token_accuracy": 0.6132998466491699,
"num_tokens": 1014215.0,
"step": 22
},
{
"epoch": 0.2929936305732484,
"grad_norm": 0.2961389720439911,
"learning_rate": 0.00019995591747081122,
"loss": 1.7635,
"mean_token_accuracy": 0.6134656071662903,
"num_tokens": 1061587.0,
"step": 23
},
{
"epoch": 0.3057324840764331,
"grad_norm": 0.3173348605632782,
"learning_rate": 0.000199936523210215,
"loss": 1.8054,
"mean_token_accuracy": 0.6050374209880829,
"num_tokens": 1108746.0,
"step": 24
},
{
"epoch": 0.3184713375796178,
"grad_norm": 0.32570838928222656,
"learning_rate": 0.00019991360433724813,
"loss": 1.7147,
"mean_token_accuracy": 0.623350203037262,
"num_tokens": 1150650.0,
"step": 25
},
{
"epoch": 0.33121019108280253,
"grad_norm": 0.31610530614852905,
"learning_rate": 0.0001998871616602251,
"loss": 1.8334,
"mean_token_accuracy": 0.6021896600723267,
"num_tokens": 1198478.0,
"step": 26
},
{
"epoch": 0.34394904458598724,
"grad_norm": 0.2649655044078827,
"learning_rate": 0.00019985719611173973,
"loss": 1.791,
"mean_token_accuracy": 0.6080193221569061,
"num_tokens": 1248602.0,
"step": 27
},
{
"epoch": 0.35668789808917195,
"grad_norm": 0.27781757712364197,
"learning_rate": 0.00019982370874863236,
"loss": 1.7948,
"mean_token_accuracy": 0.6063768863677979,
"num_tokens": 1298225.0,
"step": 28
},
{
"epoch": 0.36942675159235666,
"grad_norm": 0.35199975967407227,
"learning_rate": 0.0001997867007519524,
"loss": 1.7029,
"mean_token_accuracy": 0.6229945421218872,
"num_tokens": 1346783.0,
"step": 29
},
{
"epoch": 0.3821656050955414,
"grad_norm": 0.3464992940425873,
"learning_rate": 0.00019974617342691678,
"loss": 1.7706,
"mean_token_accuracy": 0.6096044778823853,
"num_tokens": 1394151.0,
"step": 30
},
{
"epoch": 0.39490445859872614,
"grad_norm": 0.3475406765937805,
"learning_rate": 0.00019970212820286394,
"loss": 1.755,
"mean_token_accuracy": 0.6146330833435059,
"num_tokens": 1440818.0,
"step": 31
},
{
"epoch": 0.40764331210191085,
"grad_norm": 0.30509206652641296,
"learning_rate": 0.00019965456663320329,
"loss": 1.7632,
"mean_token_accuracy": 0.611842930316925,
"num_tokens": 1486970.0,
"step": 32
},
{
"epoch": 0.42038216560509556,
"grad_norm": 0.2553170621395111,
"learning_rate": 0.00019960349039536062,
"loss": 1.7521,
"mean_token_accuracy": 0.6150202453136444,
"num_tokens": 1535132.0,
"step": 33
},
{
"epoch": 0.43312101910828027,
"grad_norm": 0.2561066746711731,
"learning_rate": 0.00019954890129071876,
"loss": 1.7303,
"mean_token_accuracy": 0.6202265918254852,
"num_tokens": 1581310.0,
"step": 34
},
{
"epoch": 0.445859872611465,
"grad_norm": 0.2694303095340729,
"learning_rate": 0.00019949080124455416,
"loss": 1.7332,
"mean_token_accuracy": 0.6190694272518158,
"num_tokens": 1626838.0,
"step": 35
},
{
"epoch": 0.4585987261146497,
"grad_norm": 0.2607475221157074,
"learning_rate": 0.00019942919230596896,
"loss": 1.7573,
"mean_token_accuracy": 0.6160352826118469,
"num_tokens": 1674100.0,
"step": 36
},
{
"epoch": 0.4713375796178344,
"grad_norm": 0.2403094321489334,
"learning_rate": 0.00019936407664781868,
"loss": 1.7641,
"mean_token_accuracy": 0.6089144349098206,
"num_tokens": 1722819.0,
"step": 37
},
{
"epoch": 0.4840764331210191,
"grad_norm": 0.24304397404193878,
"learning_rate": 0.00019929545656663562,
"loss": 1.6962,
"mean_token_accuracy": 0.6224367320537567,
"num_tokens": 1770008.0,
"step": 38
},
{
"epoch": 0.4968152866242038,
"grad_norm": 0.26098185777664185,
"learning_rate": 0.00019922333448254786,
"loss": 1.7512,
"mean_token_accuracy": 0.6127793490886688,
"num_tokens": 1815094.0,
"step": 39
},
{
"epoch": 0.5095541401273885,
"grad_norm": 0.24065393209457397,
"learning_rate": 0.00019914771293919395,
"loss": 1.7413,
"mean_token_accuracy": 0.6163510084152222,
"num_tokens": 1865027.0,
"step": 40
},
{
"epoch": 0.5222929936305732,
"grad_norm": 0.25826820731163025,
"learning_rate": 0.00019906859460363307,
"loss": 1.7384,
"mean_token_accuracy": 0.6187842190265656,
"num_tokens": 1911967.0,
"step": 41
},
{
"epoch": 0.535031847133758,
"grad_norm": 0.23422813415527344,
"learning_rate": 0.00019898598226625119,
"loss": 1.7723,
"mean_token_accuracy": 0.6120906472206116,
"num_tokens": 1963100.0,
"step": 42
},
{
"epoch": 0.5477707006369427,
"grad_norm": 0.24756181240081787,
"learning_rate": 0.00019889987884066237,
"loss": 1.711,
"mean_token_accuracy": 0.620893269777298,
"num_tokens": 2010768.0,
"step": 43
},
{
"epoch": 0.5605095541401274,
"grad_norm": 0.24499212205410004,
"learning_rate": 0.00019881028736360622,
"loss": 1.7597,
"mean_token_accuracy": 0.6143153309822083,
"num_tokens": 2059303.0,
"step": 44
},
{
"epoch": 0.5732484076433121,
"grad_norm": 0.2653355896472931,
"learning_rate": 0.0001987172109948408,
"loss": 1.7588,
"mean_token_accuracy": 0.6123422980308533,
"num_tokens": 2103829.0,
"step": 45
},
{
"epoch": 0.5859872611464968,
"grad_norm": 0.24230645596981049,
"learning_rate": 0.000198620653017031,
"loss": 1.7607,
"mean_token_accuracy": 0.6133730709552765,
"num_tokens": 2150558.0,
"step": 46
},
{
"epoch": 0.5987261146496815,
"grad_norm": 0.23600345849990845,
"learning_rate": 0.00019852061683563296,
"loss": 1.7588,
"mean_token_accuracy": 0.6099536418914795,
"num_tokens": 2201253.0,
"step": 47
},
{
"epoch": 0.6114649681528662,
"grad_norm": 0.25009065866470337,
"learning_rate": 0.00019841710597877382,
"loss": 1.7485,
"mean_token_accuracy": 0.6158089637756348,
"num_tokens": 2247382.0,
"step": 48
},
{
"epoch": 0.6242038216560509,
"grad_norm": 0.24068281054496765,
"learning_rate": 0.00019831012409712737,
"loss": 1.7542,
"mean_token_accuracy": 0.6143946349620819,
"num_tokens": 2295707.0,
"step": 49
},
{
"epoch": 0.6369426751592356,
"grad_norm": 0.28074583411216736,
"learning_rate": 0.0001981996749637853,
"loss": 1.7122,
"mean_token_accuracy": 0.6212862432003021,
"num_tokens": 2340697.0,
"step": 50
},
{
"epoch": 0.6496815286624203,
"grad_norm": 0.27374881505966187,
"learning_rate": 0.0001980857624741241,
"loss": 1.7265,
"mean_token_accuracy": 0.6174845993518829,
"num_tokens": 2382717.0,
"step": 51
},
{
"epoch": 0.6624203821656051,
"grad_norm": 0.31332576274871826,
"learning_rate": 0.00019796839064566761,
"loss": 1.7109,
"mean_token_accuracy": 0.6214545965194702,
"num_tokens": 2430219.0,
"step": 52
},
{
"epoch": 0.6751592356687898,
"grad_norm": 0.2618464529514313,
"learning_rate": 0.00019784756361794555,
"loss": 1.6771,
"mean_token_accuracy": 0.6261600852012634,
"num_tokens": 2473766.0,
"step": 53
},
{
"epoch": 0.6878980891719745,
"grad_norm": 0.25994718074798584,
"learning_rate": 0.00019772328565234717,
"loss": 1.7405,
"mean_token_accuracy": 0.6188207268714905,
"num_tokens": 2521674.0,
"step": 54
},
{
"epoch": 0.7006369426751592,
"grad_norm": 0.2400660216808319,
"learning_rate": 0.00019759556113197135,
"loss": 1.7576,
"mean_token_accuracy": 0.6164006292819977,
"num_tokens": 2570612.0,
"step": 55
},
{
"epoch": 0.7133757961783439,
"grad_norm": 0.2474898248910904,
"learning_rate": 0.00019746439456147172,
"loss": 1.6913,
"mean_token_accuracy": 0.62461718916893,
"num_tokens": 2620095.0,
"step": 56
},
{
"epoch": 0.7261146496815286,
"grad_norm": 0.2517346739768982,
"learning_rate": 0.00019732979056689794,
"loss": 1.7715,
"mean_token_accuracy": 0.6078113615512848,
"num_tokens": 2665785.0,
"step": 57
},
{
"epoch": 0.7388535031847133,
"grad_norm": 0.2567152678966522,
"learning_rate": 0.00019719175389553242,
"loss": 1.7105,
"mean_token_accuracy": 0.618989884853363,
"num_tokens": 2712064.0,
"step": 58
},
{
"epoch": 0.7515923566878981,
"grad_norm": 0.24779221415519714,
"learning_rate": 0.00019705028941572307,
"loss": 1.6769,
"mean_token_accuracy": 0.6255393028259277,
"num_tokens": 2760026.0,
"step": 59
},
{
"epoch": 0.7643312101910829,
"grad_norm": 0.2563987076282501,
"learning_rate": 0.00019690540211671144,
"loss": 1.7543,
"mean_token_accuracy": 0.6144331991672516,
"num_tokens": 2806166.0,
"step": 60
},
{
"epoch": 0.7770700636942676,
"grad_norm": 0.2323083132505417,
"learning_rate": 0.00019675709710845687,
"loss": 1.6956,
"mean_token_accuracy": 0.6225294470787048,
"num_tokens": 2855572.0,
"step": 61
},
{
"epoch": 0.7898089171974523,
"grad_norm": 0.25542232394218445,
"learning_rate": 0.0001966053796214561,
"loss": 1.6927,
"mean_token_accuracy": 0.6235709488391876,
"num_tokens": 2900646.0,
"step": 62
},
{
"epoch": 0.802547770700637,
"grad_norm": 0.24087095260620117,
"learning_rate": 0.00019645025500655906,
"loss": 1.6741,
"mean_token_accuracy": 0.6269287467002869,
"num_tokens": 2948656.0,
"step": 63
},
{
"epoch": 0.8152866242038217,
"grad_norm": 0.24608315527439117,
"learning_rate": 0.00019629172873477995,
"loss": 1.7044,
"mean_token_accuracy": 0.6225975453853607,
"num_tokens": 2992709.0,
"step": 64
},
{
"epoch": 0.8280254777070064,
"grad_norm": 0.23874063789844513,
"learning_rate": 0.00019612980639710428,
"loss": 1.6635,
"mean_token_accuracy": 0.6289187669754028,
"num_tokens": 3038992.0,
"step": 65
},
{
"epoch": 0.8407643312101911,
"grad_norm": 0.24603189527988434,
"learning_rate": 0.00019596449370429183,
"loss": 1.7611,
"mean_token_accuracy": 0.6126619875431061,
"num_tokens": 3085558.0,
"step": 66
},
{
"epoch": 0.8535031847133758,
"grad_norm": 0.24913907051086426,
"learning_rate": 0.0001957957964866751,
"loss": 1.7081,
"mean_token_accuracy": 0.6217869222164154,
"num_tokens": 3130170.0,
"step": 67
},
{
"epoch": 0.8662420382165605,
"grad_norm": 0.23950885236263275,
"learning_rate": 0.00019562372069395384,
"loss": 1.6835,
"mean_token_accuracy": 0.6236407458782196,
"num_tokens": 3176311.0,
"step": 68
},
{
"epoch": 0.8789808917197452,
"grad_norm": 0.2457829862833023,
"learning_rate": 0.000195448272394985,
"loss": 1.7195,
"mean_token_accuracy": 0.6203426420688629,
"num_tokens": 3222875.0,
"step": 69
},
{
"epoch": 0.89171974522293,
"grad_norm": 0.25021523237228394,
"learning_rate": 0.00019526945777756879,
"loss": 1.7121,
"mean_token_accuracy": 0.6217123568058014,
"num_tokens": 3271109.0,
"step": 70
},
{
"epoch": 0.9044585987261147,
"grad_norm": 0.24255377054214478,
"learning_rate": 0.00019508728314823062,
"loss": 1.6671,
"mean_token_accuracy": 0.6281636953353882,
"num_tokens": 3317571.0,
"step": 71
},
{
"epoch": 0.9171974522292994,
"grad_norm": 0.2552671432495117,
"learning_rate": 0.00019490175493199833,
"loss": 1.6851,
"mean_token_accuracy": 0.6248765289783478,
"num_tokens": 3362493.0,
"step": 72
},
{
"epoch": 0.9299363057324841,
"grad_norm": 0.24611078202724457,
"learning_rate": 0.00019471287967217594,
"loss": 1.6799,
"mean_token_accuracy": 0.6217860579490662,
"num_tokens": 3412450.0,
"step": 73
},
{
"epoch": 0.9426751592356688,
"grad_norm": 0.24427291750907898,
"learning_rate": 0.00019452066403011253,
"loss": 1.6789,
"mean_token_accuracy": 0.6255021095275879,
"num_tokens": 3458150.0,
"step": 74
},
{
"epoch": 0.9554140127388535,
"grad_norm": 0.241206556558609,
"learning_rate": 0.00019432511478496768,
"loss": 1.6791,
"mean_token_accuracy": 0.6238900423049927,
"num_tokens": 3503285.0,
"step": 75
},
{
"epoch": 0.9681528662420382,
"grad_norm": 0.24642199277877808,
"learning_rate": 0.00019412623883347207,
"loss": 1.7196,
"mean_token_accuracy": 0.6168418824672699,
"num_tokens": 3550258.0,
"step": 76
},
{
"epoch": 0.9808917197452229,
"grad_norm": 0.24044229090213776,
"learning_rate": 0.0001939240431896844,
"loss": 1.693,
"mean_token_accuracy": 0.6247681081295013,
"num_tokens": 3600054.0,
"step": 77
},
{
"epoch": 0.9936305732484076,
"grad_norm": 0.24420927464962006,
"learning_rate": 0.0001937185349847439,
"loss": 1.7288,
"mean_token_accuracy": 0.6197748780250549,
"num_tokens": 3646563.0,
"step": 78
},
{
"epoch": 1.0,
"grad_norm": 0.24420927464962006,
"learning_rate": 0.00019350972146661905,
"loss": 1.7554,
"mean_token_accuracy": 0.613867998123169,
"num_tokens": 3670636.0,
"step": 79
},
{
"epoch": 1.0127388535031847,
"grad_norm": 0.40740540623664856,
"learning_rate": 0.00019329760999985167,
"loss": 1.5665,
"mean_token_accuracy": 0.6492078900337219,
"num_tokens": 3716041.0,
"step": 80
},
{
"epoch": 1.0254777070063694,
"grad_norm": 0.27306127548217773,
"learning_rate": 0.00019308220806529738,
"loss": 1.5736,
"mean_token_accuracy": 0.6449616551399231,
"num_tokens": 3760896.0,
"step": 81
},
{
"epoch": 1.0382165605095541,
"grad_norm": 0.23415158689022064,
"learning_rate": 0.00019286352325986164,
"loss": 1.5251,
"mean_token_accuracy": 0.6536181569099426,
"num_tokens": 3807785.0,
"step": 82
},
{
"epoch": 1.0509554140127388,
"grad_norm": 0.2526198923587799,
"learning_rate": 0.00019264156329623197,
"loss": 1.5906,
"mean_token_accuracy": 0.6404092907905579,
"num_tokens": 3854182.0,
"step": 83
},
{
"epoch": 1.0636942675159236,
"grad_norm": 0.25573909282684326,
"learning_rate": 0.00019241633600260578,
"loss": 1.5242,
"mean_token_accuracy": 0.6552860736846924,
"num_tokens": 3899185.0,
"step": 84
},
{
"epoch": 1.0764331210191083,
"grad_norm": 0.26194682717323303,
"learning_rate": 0.00019218784932241434,
"loss": 1.6092,
"mean_token_accuracy": 0.6397114098072052,
"num_tokens": 3945474.0,
"step": 85
},
{
"epoch": 1.089171974522293,
"grad_norm": 0.26084014773368835,
"learning_rate": 0.0001919561113140427,
"loss": 1.5654,
"mean_token_accuracy": 0.6496731340885162,
"num_tokens": 3993818.0,
"step": 86
},
{
"epoch": 1.1019108280254777,
"grad_norm": 0.25661009550094604,
"learning_rate": 0.00019172113015054532,
"loss": 1.5956,
"mean_token_accuracy": 0.6394364237785339,
"num_tokens": 4043789.0,
"step": 87
},
{
"epoch": 1.1146496815286624,
"grad_norm": 0.26299285888671875,
"learning_rate": 0.00019148291411935796,
"loss": 1.5534,
"mean_token_accuracy": 0.648574948310852,
"num_tokens": 4092145.0,
"step": 88
},
{
"epoch": 1.127388535031847,
"grad_norm": 0.2560042440891266,
"learning_rate": 0.00019124147162200535,
"loss": 1.5341,
"mean_token_accuracy": 0.6515755355358124,
"num_tokens": 4136793.0,
"step": 89
},
{
"epoch": 1.1401273885350318,
"grad_norm": 0.250197172164917,
"learning_rate": 0.00019099681117380486,
"loss": 1.5691,
"mean_token_accuracy": 0.6437222361564636,
"num_tokens": 4186081.0,
"step": 90
},
{
"epoch": 1.1528662420382165,
"grad_norm": 0.2830899655818939,
"learning_rate": 0.00019074894140356624,
"loss": 1.5533,
"mean_token_accuracy": 0.6474398970603943,
"num_tokens": 4230818.0,
"step": 91
},
{
"epoch": 1.1656050955414012,
"grad_norm": 0.2672581672668457,
"learning_rate": 0.00019049787105328715,
"loss": 1.5768,
"mean_token_accuracy": 0.6421504616737366,
"num_tokens": 4280136.0,
"step": 92
},
{
"epoch": 1.178343949044586,
"grad_norm": 0.27740785479545593,
"learning_rate": 0.00019024360897784508,
"loss": 1.5441,
"mean_token_accuracy": 0.6503708958625793,
"num_tokens": 4325269.0,
"step": 93
},
{
"epoch": 1.1910828025477707,
"grad_norm": 0.2790956497192383,
"learning_rate": 0.00018998616414468478,
"loss": 1.5136,
"mean_token_accuracy": 0.6548562347888947,
"num_tokens": 4371962.0,
"step": 94
},
{
"epoch": 1.2038216560509554,
"grad_norm": 0.25887349247932434,
"learning_rate": 0.0001897255456335022,
"loss": 1.5639,
"mean_token_accuracy": 0.6482616662979126,
"num_tokens": 4420381.0,
"step": 95
},
{
"epoch": 1.21656050955414,
"grad_norm": 0.2554098963737488,
"learning_rate": 0.0001894617626359242,
"loss": 1.5673,
"mean_token_accuracy": 0.6444060206413269,
"num_tokens": 4468056.0,
"step": 96
},
{
"epoch": 1.2292993630573248,
"grad_norm": 0.27086755633354187,
"learning_rate": 0.00018919482445518436,
"loss": 1.554,
"mean_token_accuracy": 0.6515795886516571,
"num_tokens": 4511736.0,
"step": 97
},
{
"epoch": 1.2420382165605095,
"grad_norm": 0.26914721727371216,
"learning_rate": 0.0001889247405057948,
"loss": 1.5007,
"mean_token_accuracy": 0.6585707366466522,
"num_tokens": 4556021.0,
"step": 98
},
{
"epoch": 1.2547770700636942,
"grad_norm": 0.2745961844921112,
"learning_rate": 0.00018865152031321427,
"loss": 1.4936,
"mean_token_accuracy": 0.6575806736946106,
"num_tokens": 4601988.0,
"step": 99
},
{
"epoch": 1.267515923566879,
"grad_norm": 0.26875782012939453,
"learning_rate": 0.00018837517351351214,
"loss": 1.515,
"mean_token_accuracy": 0.6536067724227905,
"num_tokens": 4649310.0,
"step": 100
},
{
"epoch": 1.2802547770700636,
"grad_norm": 0.28102368116378784,
"learning_rate": 0.00018809570985302862,
"loss": 1.5216,
"mean_token_accuracy": 0.6557919979095459,
"num_tokens": 4696205.0,
"step": 101
},
{
"epoch": 1.2929936305732483,
"grad_norm": 0.267914354801178,
"learning_rate": 0.00018781313918803086,
"loss": 1.571,
"mean_token_accuracy": 0.6473680436611176,
"num_tokens": 4745047.0,
"step": 102
},
{
"epoch": 1.305732484076433,
"grad_norm": 0.2804099917411804,
"learning_rate": 0.00018752747148436543,
"loss": 1.6039,
"mean_token_accuracy": 0.639825314283371,
"num_tokens": 4791232.0,
"step": 103
},
{
"epoch": 1.3184713375796178,
"grad_norm": 0.27488934993743896,
"learning_rate": 0.00018723871681710697,
"loss": 1.5494,
"mean_token_accuracy": 0.6497779786586761,
"num_tokens": 4837675.0,
"step": 104
},
{
"epoch": 1.3312101910828025,
"grad_norm": 0.2697705328464508,
"learning_rate": 0.0001869468853702026,
"loss": 1.4995,
"mean_token_accuracy": 0.656253308057785,
"num_tokens": 4883626.0,
"step": 105
},
{
"epoch": 1.3439490445859872,
"grad_norm": 0.26725390553474426,
"learning_rate": 0.0001866519874361129,
"loss": 1.5777,
"mean_token_accuracy": 0.6452081203460693,
"num_tokens": 4931577.0,
"step": 106
},
{
"epoch": 1.356687898089172,
"grad_norm": 0.2720169425010681,
"learning_rate": 0.000186354033415449,
"loss": 1.5281,
"mean_token_accuracy": 0.6508583128452301,
"num_tokens": 4978688.0,
"step": 107
},
{
"epoch": 1.3694267515923566,
"grad_norm": 0.2662588059902191,
"learning_rate": 0.00018605303381660543,
"loss": 1.53,
"mean_token_accuracy": 0.6532346308231354,
"num_tokens": 5024797.0,
"step": 108
},
{
"epoch": 1.3821656050955413,
"grad_norm": 0.28359687328338623,
"learning_rate": 0.00018574899925538998,
"loss": 1.5452,
"mean_token_accuracy": 0.6506541073322296,
"num_tokens": 5070097.0,
"step": 109
},
{
"epoch": 1.394904458598726,
"grad_norm": 0.2859072983264923,
"learning_rate": 0.00018544194045464886,
"loss": 1.6259,
"mean_token_accuracy": 0.6363864541053772,
"num_tokens": 5117390.0,
"step": 110
},
{
"epoch": 1.4076433121019107,
"grad_norm": 0.2912904620170593,
"learning_rate": 0.00018513186824388879,
"loss": 1.5479,
"mean_token_accuracy": 0.6520430743694305,
"num_tokens": 5163069.0,
"step": 111
},
{
"epoch": 1.4203821656050954,
"grad_norm": 0.263398140668869,
"learning_rate": 0.00018481879355889495,
"loss": 1.5585,
"mean_token_accuracy": 0.6469611525535583,
"num_tokens": 5207392.0,
"step": 112
},
{
"epoch": 1.4331210191082802,
"grad_norm": 0.26866281032562256,
"learning_rate": 0.00018450272744134532,
"loss": 1.5415,
"mean_token_accuracy": 0.6510675251483917,
"num_tokens": 5256951.0,
"step": 113
},
{
"epoch": 1.4458598726114649,
"grad_norm": 0.2799576222896576,
"learning_rate": 0.00018418368103842125,
"loss": 1.5396,
"mean_token_accuracy": 0.6497272849082947,
"num_tokens": 5304169.0,
"step": 114
},
{
"epoch": 1.4585987261146496,
"grad_norm": 0.27718910574913025,
"learning_rate": 0.00018386166560241434,
"loss": 1.5567,
"mean_token_accuracy": 0.6481947600841522,
"num_tokens": 5351483.0,
"step": 115
},
{
"epoch": 1.4713375796178343,
"grad_norm": 0.2619563639163971,
"learning_rate": 0.0001835366924903295,
"loss": 1.496,
"mean_token_accuracy": 0.6585268080234528,
"num_tokens": 5398507.0,
"step": 116
},
{
"epoch": 1.484076433121019,
"grad_norm": 0.29501011967658997,
"learning_rate": 0.00018320877316348454,
"loss": 1.5351,
"mean_token_accuracy": 0.6495955288410187,
"num_tokens": 5445868.0,
"step": 117
},
{
"epoch": 1.4968152866242037,
"grad_norm": 0.2873230576515198,
"learning_rate": 0.00018287791918710587,
"loss": 1.5845,
"mean_token_accuracy": 0.643306702375412,
"num_tokens": 5496468.0,
"step": 118
},
{
"epoch": 1.5095541401273884,
"grad_norm": 0.2742498517036438,
"learning_rate": 0.0001825441422299206,
"loss": 1.53,
"mean_token_accuracy": 0.6520735919475555,
"num_tokens": 5543365.0,
"step": 119
},
{
"epoch": 1.5222929936305731,
"grad_norm": 0.28084686398506165,
"learning_rate": 0.00018220745406374498,
"loss": 1.5315,
"mean_token_accuracy": 0.6501257419586182,
"num_tokens": 5590745.0,
"step": 120
},
{
"epoch": 1.5350318471337578,
"grad_norm": 0.2685016691684723,
"learning_rate": 0.00018186786656306935,
"loss": 1.4894,
"mean_token_accuracy": 0.6595437228679657,
"num_tokens": 5635933.0,
"step": 121
},
{
"epoch": 1.5477707006369426,
"grad_norm": 0.28692150115966797,
"learning_rate": 0.00018152539170463925,
"loss": 1.5553,
"mean_token_accuracy": 0.6456755995750427,
"num_tokens": 5685983.0,
"step": 122
},
{
"epoch": 1.5605095541401273,
"grad_norm": 0.2563268542289734,
"learning_rate": 0.00018118004156703296,
"loss": 1.519,
"mean_token_accuracy": 0.652580201625824,
"num_tokens": 5734780.0,
"step": 123
},
{
"epoch": 1.573248407643312,
"grad_norm": 0.28583434224128723,
"learning_rate": 0.00018083182833023562,
"loss": 1.5127,
"mean_token_accuracy": 0.6557912826538086,
"num_tokens": 5779041.0,
"step": 124
},
{
"epoch": 1.5859872611464967,
"grad_norm": 0.2815837562084198,
"learning_rate": 0.0001804807642752096,
"loss": 1.5519,
"mean_token_accuracy": 0.6499836444854736,
"num_tokens": 5825179.0,
"step": 125
},
{
"epoch": 1.5987261146496814,
"grad_norm": 0.27144506573677063,
"learning_rate": 0.00018012686178346142,
"loss": 1.5583,
"mean_token_accuracy": 0.6471421718597412,
"num_tokens": 5872958.0,
"step": 126
},
{
"epoch": 1.611464968152866,
"grad_norm": 0.31989362835884094,
"learning_rate": 0.000179770133336605,
"loss": 1.5479,
"mean_token_accuracy": 0.6509740650653839,
"num_tokens": 5919853.0,
"step": 127
},
{
"epoch": 1.6242038216560508,
"grad_norm": 0.28704020380973816,
"learning_rate": 0.00017941059151592147,
"loss": 1.5107,
"mean_token_accuracy": 0.6552367806434631,
"num_tokens": 5966036.0,
"step": 128
},
{
"epoch": 1.6369426751592355,
"grad_norm": 0.27532413601875305,
"learning_rate": 0.00017904824900191556,
"loss": 1.5274,
"mean_token_accuracy": 0.6521405279636383,
"num_tokens": 6013929.0,
"step": 129
},
{
"epoch": 1.6496815286624202,
"grad_norm": 0.2861412465572357,
"learning_rate": 0.0001786831185738682,
"loss": 1.5653,
"mean_token_accuracy": 0.6448757648468018,
"num_tokens": 6060218.0,
"step": 130
},
{
"epoch": 1.662420382165605,
"grad_norm": 0.28631675243377686,
"learning_rate": 0.0001783152131093859,
"loss": 1.5357,
"mean_token_accuracy": 0.6499184668064117,
"num_tokens": 6105536.0,
"step": 131
},
{
"epoch": 1.6751592356687897,
"grad_norm": 0.2932698726654053,
"learning_rate": 0.00017794454558394657,
"loss": 1.5251,
"mean_token_accuracy": 0.6529253423213959,
"num_tokens": 6153129.0,
"step": 132
},
{
"epoch": 1.6878980891719744,
"grad_norm": 0.2933589518070221,
"learning_rate": 0.000177571129070442,
"loss": 1.5223,
"mean_token_accuracy": 0.6531689465045929,
"num_tokens": 6199056.0,
"step": 133
},
{
"epoch": 1.700636942675159,
"grad_norm": 0.2958078682422638,
"learning_rate": 0.00017719497673871653,
"loss": 1.5571,
"mean_token_accuracy": 0.6457672417163849,
"num_tokens": 6244782.0,
"step": 134
},
{
"epoch": 1.7133757961783438,
"grad_norm": 0.30723750591278076,
"learning_rate": 0.00017681610185510285,
"loss": 1.5099,
"mean_token_accuracy": 0.6570196449756622,
"num_tokens": 6287317.0,
"step": 135
},
{
"epoch": 1.7261146496815285,
"grad_norm": 0.28479403257369995,
"learning_rate": 0.00017643451778195395,
"loss": 1.5438,
"mean_token_accuracy": 0.6486569344997406,
"num_tokens": 6335678.0,
"step": 136
},
{
"epoch": 1.7388535031847132,
"grad_norm": 0.2733410596847534,
"learning_rate": 0.00017605023797717195,
"loss": 1.5444,
"mean_token_accuracy": 0.6485359966754913,
"num_tokens": 6382512.0,
"step": 137
},
{
"epoch": 1.7515923566878981,
"grad_norm": 0.2998912036418915,
"learning_rate": 0.00017566327599373338,
"loss": 1.4791,
"mean_token_accuracy": 0.6596002280712128,
"num_tokens": 6427147.0,
"step": 138
},
{
"epoch": 1.7643312101910829,
"grad_norm": 0.28666678071022034,
"learning_rate": 0.0001752736454792112,
"loss": 1.599,
"mean_token_accuracy": 0.6427422761917114,
"num_tokens": 6474652.0,
"step": 139
},
{
"epoch": 1.7770700636942676,
"grad_norm": 0.280900776386261,
"learning_rate": 0.0001748813601752935,
"loss": 1.541,
"mean_token_accuracy": 0.6483757197856903,
"num_tokens": 6523870.0,
"step": 140
},
{
"epoch": 1.7898089171974523,
"grad_norm": 0.26936545968055725,
"learning_rate": 0.00017448643391729888,
"loss": 1.5666,
"mean_token_accuracy": 0.6445654630661011,
"num_tokens": 6570400.0,
"step": 141
},
{
"epoch": 1.802547770700637,
"grad_norm": 0.30444443225860596,
"learning_rate": 0.0001740888806336884,
"loss": 1.5731,
"mean_token_accuracy": 0.6429518759250641,
"num_tokens": 6616340.0,
"step": 142
},
{
"epoch": 1.8152866242038217,
"grad_norm": 0.278298944234848,
"learning_rate": 0.00017368871434557447,
"loss": 1.5337,
"mean_token_accuracy": 0.6487603783607483,
"num_tokens": 6663529.0,
"step": 143
},
{
"epoch": 1.8280254777070064,
"grad_norm": 0.2908456027507782,
"learning_rate": 0.00017328594916622616,
"loss": 1.5363,
"mean_token_accuracy": 0.650389701128006,
"num_tokens": 6708731.0,
"step": 144
},
{
"epoch": 1.8407643312101911,
"grad_norm": 0.2893330454826355,
"learning_rate": 0.00017288059930057166,
"loss": 1.5415,
"mean_token_accuracy": 0.6505038142204285,
"num_tokens": 6757212.0,
"step": 145
},
{
"epoch": 1.8535031847133758,
"grad_norm": 0.30690449476242065,
"learning_rate": 0.00017247267904469725,
"loss": 1.5387,
"mean_token_accuracy": 0.6517972648143768,
"num_tokens": 6799983.0,
"step": 146
},
{
"epoch": 1.8662420382165605,
"grad_norm": 0.2818317115306854,
"learning_rate": 0.00017206220278534286,
"loss": 1.5747,
"mean_token_accuracy": 0.6467372477054596,
"num_tokens": 6848592.0,
"step": 147
},
{
"epoch": 1.8789808917197452,
"grad_norm": 0.2880898118019104,
"learning_rate": 0.00017164918499939504,
"loss": 1.6025,
"mean_token_accuracy": 0.6399553418159485,
"num_tokens": 6897858.0,
"step": 148
},
{
"epoch": 1.89171974522293,
"grad_norm": 0.26849091053009033,
"learning_rate": 0.0001712336402533761,
"loss": 1.5618,
"mean_token_accuracy": 0.6450689435005188,
"num_tokens": 6945803.0,
"step": 149
},
{
"epoch": 1.9044585987261147,
"grad_norm": 0.28507912158966064,
"learning_rate": 0.00017081558320293055,
"loss": 1.5794,
"mean_token_accuracy": 0.6418361663818359,
"num_tokens": 6992743.0,
"step": 150
},
{
"epoch": 1.9171974522292994,
"grad_norm": 0.29636260867118835,
"learning_rate": 0.000170395028592308,
"loss": 1.5468,
"mean_token_accuracy": 0.6484410464763641,
"num_tokens": 7039309.0,
"step": 151
},
{
"epoch": 1.929936305732484,
"grad_norm": 0.2758314609527588,
"learning_rate": 0.00016997199125384343,
"loss": 1.546,
"mean_token_accuracy": 0.6494967639446259,
"num_tokens": 7084598.0,
"step": 152
},
{
"epoch": 1.9426751592356688,
"grad_norm": 0.2995888590812683,
"learning_rate": 0.00016954648610743384,
"loss": 1.5199,
"mean_token_accuracy": 0.6539457738399506,
"num_tokens": 7132905.0,
"step": 153
},
{
"epoch": 1.9554140127388535,
"grad_norm": 0.2744024693965912,
"learning_rate": 0.0001691185281600122,
"loss": 1.5506,
"mean_token_accuracy": 0.6450865864753723,
"num_tokens": 7179607.0,
"step": 154
},
{
"epoch": 1.9681528662420382,
"grad_norm": 0.2939317226409912,
"learning_rate": 0.0001686881325050181,
"loss": 1.5632,
"mean_token_accuracy": 0.645559161901474,
"num_tokens": 7227433.0,
"step": 155
},
{
"epoch": 1.980891719745223,
"grad_norm": 0.294448584318161,
"learning_rate": 0.00016825531432186543,
"loss": 1.5284,
"mean_token_accuracy": 0.6512192487716675,
"num_tokens": 7272804.0,
"step": 156
},
{
"epoch": 1.9936305732484076,
"grad_norm": 0.2998405992984772,
"learning_rate": 0.00016782008887540704,
"loss": 1.4948,
"mean_token_accuracy": 0.65907222032547,
"num_tokens": 7318264.0,
"step": 157
},
{
"epoch": 2.0,
"grad_norm": 0.4484761655330658,
"learning_rate": 0.00016738247151539643,
"loss": 1.4407,
"mean_token_accuracy": 0.6714723706245422,
"num_tokens": 7341116.0,
"step": 158
},
{
"epoch": 2.0127388535031847,
"grad_norm": 0.3343365788459778,
"learning_rate": 0.00016694247767594624,
"loss": 1.3322,
"mean_token_accuracy": 0.6910092234611511,
"num_tokens": 7385765.0,
"step": 159
},
{
"epoch": 2.0254777070063694,
"grad_norm": 0.3265499472618103,
"learning_rate": 0.00016650012287498412,
"loss": 1.3301,
"mean_token_accuracy": 0.6870517134666443,
"num_tokens": 7431409.0,
"step": 160
},
{
"epoch": 2.038216560509554,
"grad_norm": 0.2959946393966675,
"learning_rate": 0.00016605542271370513,
"loss": 1.3674,
"mean_token_accuracy": 0.6844088733196259,
"num_tokens": 7480191.0,
"step": 161
},
{
"epoch": 2.050955414012739,
"grad_norm": 0.3199387192726135,
"learning_rate": 0.00016560839287602192,
"loss": 1.2926,
"mean_token_accuracy": 0.6962210536003113,
"num_tokens": 7528150.0,
"step": 162
},
{
"epoch": 2.0636942675159236,
"grad_norm": 0.36283308267593384,
"learning_rate": 0.00016515904912801118,
"loss": 1.2666,
"mean_token_accuracy": 0.6986918449401855,
"num_tokens": 7571869.0,
"step": 163
},
{
"epoch": 2.0764331210191083,
"grad_norm": 0.34669721126556396,
"learning_rate": 0.00016470740731735787,
"loss": 1.3234,
"mean_token_accuracy": 0.6908857524394989,
"num_tokens": 7618015.0,
"step": 164
},
{
"epoch": 2.089171974522293,
"grad_norm": 0.34525468945503235,
"learning_rate": 0.0001642534833727962,
"loss": 1.2866,
"mean_token_accuracy": 0.6964756846427917,
"num_tokens": 7662549.0,
"step": 165
},
{
"epoch": 2.1019108280254777,
"grad_norm": 0.3327886760234833,
"learning_rate": 0.00016379729330354774,
"loss": 1.3065,
"mean_token_accuracy": 0.6932984590530396,
"num_tokens": 7709697.0,
"step": 166
},
{
"epoch": 2.1146496815286624,
"grad_norm": 0.30664750933647156,
"learning_rate": 0.00016333885319875702,
"loss": 1.2929,
"mean_token_accuracy": 0.6956894993782043,
"num_tokens": 7758083.0,
"step": 167
},
{
"epoch": 2.127388535031847,
"grad_norm": 0.3107092082500458,
"learning_rate": 0.00016287817922692395,
"loss": 1.3376,
"mean_token_accuracy": 0.6897503137588501,
"num_tokens": 7805938.0,
"step": 168
},
{
"epoch": 2.140127388535032,
"grad_norm": 0.31660640239715576,
"learning_rate": 0.00016241528763533353,
"loss": 1.2791,
"mean_token_accuracy": 0.6975639164447784,
"num_tokens": 7850498.0,
"step": 169
},
{
"epoch": 2.1528662420382165,
"grad_norm": 0.32096031308174133,
"learning_rate": 0.00016195019474948299,
"loss": 1.2405,
"mean_token_accuracy": 0.7077115774154663,
"num_tokens": 7893227.0,
"step": 170
},
{
"epoch": 2.1656050955414012,
"grad_norm": 0.34041303396224976,
"learning_rate": 0.00016148291697250594,
"loss": 1.331,
"mean_token_accuracy": 0.6875595152378082,
"num_tokens": 7939866.0,
"step": 171
},
{
"epoch": 2.178343949044586,
"grad_norm": 0.3158988952636719,
"learning_rate": 0.00016101347078459373,
"loss": 1.3103,
"mean_token_accuracy": 0.6904300153255463,
"num_tokens": 7989324.0,
"step": 172
},
{
"epoch": 2.1910828025477707,
"grad_norm": 0.31509461998939514,
"learning_rate": 0.0001605418727424145,
"loss": 1.3244,
"mean_token_accuracy": 0.6885357201099396,
"num_tokens": 8037303.0,
"step": 173
},
{
"epoch": 2.2038216560509554,
"grad_norm": 0.32755744457244873,
"learning_rate": 0.00016006813947852893,
"loss": 1.2938,
"mean_token_accuracy": 0.6945713758468628,
"num_tokens": 8083490.0,
"step": 174
},
{
"epoch": 2.21656050955414,
"grad_norm": 0.326424241065979,
"learning_rate": 0.0001595922877008039,
"loss": 1.2883,
"mean_token_accuracy": 0.6961071789264679,
"num_tokens": 8130322.0,
"step": 175
},
{
"epoch": 2.229299363057325,
"grad_norm": 0.33139878511428833,
"learning_rate": 0.00015911433419182305,
"loss": 1.3053,
"mean_token_accuracy": 0.6951516270637512,
"num_tokens": 8178618.0,
"step": 176
},
{
"epoch": 2.2420382165605095,
"grad_norm": 0.33605796098709106,
"learning_rate": 0.000158634295808295,
"loss": 1.3198,
"mean_token_accuracy": 0.6912129521369934,
"num_tokens": 8227676.0,
"step": 177
},
{
"epoch": 2.254777070063694,
"grad_norm": 0.3550015091896057,
"learning_rate": 0.00015815218948045878,
"loss": 1.2881,
"mean_token_accuracy": 0.6993768513202667,
"num_tokens": 8271080.0,
"step": 178
},
{
"epoch": 2.267515923566879,
"grad_norm": 0.34364157915115356,
"learning_rate": 0.00015766803221148673,
"loss": 1.337,
"mean_token_accuracy": 0.6868195235729218,
"num_tokens": 8319718.0,
"step": 179
},
{
"epoch": 2.2802547770700636,
"grad_norm": 0.34193143248558044,
"learning_rate": 0.0001571818410768848,
"loss": 1.3162,
"mean_token_accuracy": 0.6915777623653412,
"num_tokens": 8365783.0,
"step": 180
},
{
"epoch": 2.2929936305732483,
"grad_norm": 0.32836443185806274,
"learning_rate": 0.0001566936332238904,
"loss": 1.3102,
"mean_token_accuracy": 0.6936459541320801,
"num_tokens": 8414953.0,
"step": 181
},
{
"epoch": 2.305732484076433,
"grad_norm": 0.3303191065788269,
"learning_rate": 0.0001562034258708676,
"loss": 1.302,
"mean_token_accuracy": 0.6961067020893097,
"num_tokens": 8461084.0,
"step": 182
},
{
"epoch": 2.3184713375796178,
"grad_norm": 0.3395134508609772,
"learning_rate": 0.0001557112363066998,
"loss": 1.2847,
"mean_token_accuracy": 0.6985503137111664,
"num_tokens": 8503630.0,
"step": 183
},
{
"epoch": 2.3312101910828025,
"grad_norm": 0.34719496965408325,
"learning_rate": 0.00015521708189018005,
"loss": 1.3131,
"mean_token_accuracy": 0.6886778473854065,
"num_tokens": 8549241.0,
"step": 184
},
{
"epoch": 2.343949044585987,
"grad_norm": 0.342877060174942,
"learning_rate": 0.00015472098004939888,
"loss": 1.3407,
"mean_token_accuracy": 0.6869197189807892,
"num_tokens": 8596933.0,
"step": 185
},
{
"epoch": 2.356687898089172,
"grad_norm": 0.32749322056770325,
"learning_rate": 0.00015422294828112954,
"loss": 1.286,
"mean_token_accuracy": 0.6954855024814606,
"num_tokens": 8645281.0,
"step": 186
},
{
"epoch": 2.3694267515923566,
"grad_norm": 0.35311228036880493,
"learning_rate": 0.00015372300415021091,
"loss": 1.2954,
"mean_token_accuracy": 0.6963195204734802,
"num_tokens": 8691586.0,
"step": 187
},
{
"epoch": 2.3821656050955413,
"grad_norm": 0.3434406518936157,
"learning_rate": 0.00015322116528892807,
"loss": 1.2902,
"mean_token_accuracy": 0.6954045593738556,
"num_tokens": 8738642.0,
"step": 188
},
{
"epoch": 2.394904458598726,
"grad_norm": 0.34454143047332764,
"learning_rate": 0.0001527174493963905,
"loss": 1.329,
"mean_token_accuracy": 0.6872740387916565,
"num_tokens": 8785494.0,
"step": 189
},
{
"epoch": 2.4076433121019107,
"grad_norm": 0.3454861640930176,
"learning_rate": 0.0001522118742379076,
"loss": 1.3279,
"mean_token_accuracy": 0.687510758638382,
"num_tokens": 8833002.0,
"step": 190
},
{
"epoch": 2.4203821656050954,
"grad_norm": 0.342602401971817,
"learning_rate": 0.00015170445764436252,
"loss": 1.3414,
"mean_token_accuracy": 0.6878556907176971,
"num_tokens": 8881670.0,
"step": 191
},
{
"epoch": 2.43312101910828,
"grad_norm": 0.3364247977733612,
"learning_rate": 0.00015119521751158296,
"loss": 1.2873,
"mean_token_accuracy": 0.6955643892288208,
"num_tokens": 8928589.0,
"step": 192
},
{
"epoch": 2.445859872611465,
"grad_norm": 0.3498151898384094,
"learning_rate": 0.00015068417179971014,
"loss": 1.3165,
"mean_token_accuracy": 0.6920604407787323,
"num_tokens": 8972786.0,
"step": 193
},
{
"epoch": 2.4585987261146496,
"grad_norm": 0.3346851170063019,
"learning_rate": 0.00015017133853256537,
"loss": 1.3256,
"mean_token_accuracy": 0.692162960767746,
"num_tokens": 9023468.0,
"step": 194
},
{
"epoch": 2.4713375796178343,
"grad_norm": 0.35006558895111084,
"learning_rate": 0.00014965673579701445,
"loss": 1.2724,
"mean_token_accuracy": 0.7002449333667755,
"num_tokens": 9068145.0,
"step": 195
},
{
"epoch": 2.484076433121019,
"grad_norm": 0.34246891736984253,
"learning_rate": 0.00014914038174232956,
"loss": 1.3404,
"mean_token_accuracy": 0.6872991621494293,
"num_tokens": 9118948.0,
"step": 196
},
{
"epoch": 2.4968152866242037,
"grad_norm": 0.3341098129749298,
"learning_rate": 0.0001486222945795494,
"loss": 1.3156,
"mean_token_accuracy": 0.6871801018714905,
"num_tokens": 9166164.0,
"step": 197
},
{
"epoch": 2.5095541401273884,
"grad_norm": 0.34007757902145386,
"learning_rate": 0.00014810249258083677,
"loss": 1.3102,
"mean_token_accuracy": 0.6924366652965546,
"num_tokens": 9214691.0,
"step": 198
},
{
"epoch": 2.522292993630573,
"grad_norm": 0.3317483365535736,
"learning_rate": 0.00014758099407883422,
"loss": 1.3083,
"mean_token_accuracy": 0.6904500126838684,
"num_tokens": 9264180.0,
"step": 199
},
{
"epoch": 2.535031847133758,
"grad_norm": 0.3468264043331146,
"learning_rate": 0.0001470578174660174,
"loss": 1.3293,
"mean_token_accuracy": 0.6916395723819733,
"num_tokens": 9311651.0,
"step": 200
},
{
"epoch": 2.5477707006369426,
"grad_norm": 0.3456972539424896,
"learning_rate": 0.00014653298119404645,
"loss": 1.3268,
"mean_token_accuracy": 0.6869567632675171,
"num_tokens": 9360999.0,
"step": 201
},
{
"epoch": 2.5605095541401273,
"grad_norm": 0.35997506976127625,
"learning_rate": 0.00014600650377311522,
"loss": 1.3105,
"mean_token_accuracy": 0.6917800903320312,
"num_tokens": 9405644.0,
"step": 202
},
{
"epoch": 2.573248407643312,
"grad_norm": 0.3483164310455322,
"learning_rate": 0.00014547840377129842,
"loss": 1.3148,
"mean_token_accuracy": 0.6925802230834961,
"num_tokens": 9451607.0,
"step": 203
},
{
"epoch": 2.5859872611464967,
"grad_norm": 0.3380853235721588,
"learning_rate": 0.0001449486998138968,
"loss": 1.304,
"mean_token_accuracy": 0.6935497522354126,
"num_tokens": 9498424.0,
"step": 204
},
{
"epoch": 2.5987261146496814,
"grad_norm": 0.36971330642700195,
"learning_rate": 0.00014441741058278024,
"loss": 1.2874,
"mean_token_accuracy": 0.6996894776821136,
"num_tokens": 9540724.0,
"step": 205
},
{
"epoch": 2.611464968152866,
"grad_norm": 0.3429723381996155,
"learning_rate": 0.0001438845548157288,
"loss": 1.309,
"mean_token_accuracy": 0.692668229341507,
"num_tokens": 9588689.0,
"step": 206
},
{
"epoch": 2.624203821656051,
"grad_norm": 0.3566606342792511,
"learning_rate": 0.000143350151305772,
"loss": 1.3495,
"mean_token_accuracy": 0.684135228395462,
"num_tokens": 9636532.0,
"step": 207
},
{
"epoch": 2.6369426751592355,
"grad_norm": 0.3401079773902893,
"learning_rate": 0.0001428142189005259,
"loss": 1.3193,
"mean_token_accuracy": 0.6945083439350128,
"num_tokens": 9685613.0,
"step": 208
},
{
"epoch": 2.6496815286624202,
"grad_norm": 0.3454475998878479,
"learning_rate": 0.0001422767765015285,
"loss": 1.3007,
"mean_token_accuracy": 0.6913789212703705,
"num_tokens": 9733242.0,
"step": 209
},
{
"epoch": 2.662420382165605,
"grad_norm": 0.36231961846351624,
"learning_rate": 0.0001417378430635729,
"loss": 1.253,
"mean_token_accuracy": 0.7031304240226746,
"num_tokens": 9776947.0,
"step": 210
},
{
"epoch": 2.6751592356687897,
"grad_norm": 0.3470020890235901,
"learning_rate": 0.00014119743759403907,
"loss": 1.341,
"mean_token_accuracy": 0.6853951811790466,
"num_tokens": 9824542.0,
"step": 211
},
{
"epoch": 2.6878980891719744,
"grad_norm": 0.35202592611312866,
"learning_rate": 0.00014065557915222322,
"loss": 1.3058,
"mean_token_accuracy": 0.691655308008194,
"num_tokens": 9871224.0,
"step": 212
},
{
"epoch": 2.700636942675159,
"grad_norm": 0.3493707478046417,
"learning_rate": 0.00014011228684866582,
"loss": 1.3376,
"mean_token_accuracy": 0.6874703168869019,
"num_tokens": 9920118.0,
"step": 213
},
{
"epoch": 2.713375796178344,
"grad_norm": 0.35377079248428345,
"learning_rate": 0.00013956757984447745,
"loss": 1.2805,
"mean_token_accuracy": 0.6971912980079651,
"num_tokens": 9963918.0,
"step": 214
},
{
"epoch": 2.7261146496815285,
"grad_norm": 0.3466252386569977,
"learning_rate": 0.00013902147735066306,
"loss": 1.2664,
"mean_token_accuracy": 0.6998610198497772,
"num_tokens": 10010058.0,
"step": 215
},
{
"epoch": 2.738853503184713,
"grad_norm": 0.3474418520927429,
"learning_rate": 0.0001384739986274445,
"loss": 1.2961,
"mean_token_accuracy": 0.6941092908382416,
"num_tokens": 10058468.0,
"step": 216
},
{
"epoch": 2.7515923566878984,
"grad_norm": 0.36090087890625,
"learning_rate": 0.00013792516298358114,
"loss": 1.3642,
"mean_token_accuracy": 0.6834468245506287,
"num_tokens": 10106765.0,
"step": 217
},
{
"epoch": 2.7643312101910826,
"grad_norm": 0.3633421063423157,
"learning_rate": 0.000137374989775689,
"loss": 1.3233,
"mean_token_accuracy": 0.6901079416275024,
"num_tokens": 10152807.0,
"step": 218
},
{
"epoch": 2.777070063694268,
"grad_norm": 0.34589487314224243,
"learning_rate": 0.00013682349840755785,
"loss": 1.2613,
"mean_token_accuracy": 0.7022227048873901,
"num_tokens": 10198115.0,
"step": 219
},
{
"epoch": 2.789808917197452,
"grad_norm": 0.34732723236083984,
"learning_rate": 0.00013627070832946718,
"loss": 1.3236,
"mean_token_accuracy": 0.6895630061626434,
"num_tokens": 10244677.0,
"step": 220
},
{
"epoch": 2.802547770700637,
"grad_norm": 0.35598820447921753,
"learning_rate": 0.00013571663903749984,
"loss": 1.2993,
"mean_token_accuracy": 0.6935286521911621,
"num_tokens": 10289391.0,
"step": 221
},
{
"epoch": 2.8152866242038215,
"grad_norm": 0.3413410186767578,
"learning_rate": 0.00013516131007285483,
"loss": 1.3134,
"mean_token_accuracy": 0.6913627684116364,
"num_tokens": 10336052.0,
"step": 222
},
{
"epoch": 2.8280254777070066,
"grad_norm": 0.3477303981781006,
"learning_rate": 0.00013460474102115785,
"loss": 1.2962,
"mean_token_accuracy": 0.6957099437713623,
"num_tokens": 10381705.0,
"step": 223
},
{
"epoch": 2.840764331210191,
"grad_norm": 0.3488887548446655,
"learning_rate": 0.0001340469515117706,
"loss": 1.3512,
"mean_token_accuracy": 0.6867388784885406,
"num_tokens": 10430510.0,
"step": 224
},
{
"epoch": 2.853503184713376,
"grad_norm": 0.38249075412750244,
"learning_rate": 0.00013348796121709862,
"loss": 1.3002,
"mean_token_accuracy": 0.693688690662384,
"num_tokens": 10475799.0,
"step": 225
},
{
"epoch": 2.8662420382165603,
"grad_norm": 0.3548857867717743,
"learning_rate": 0.00013292778985189724,
"loss": 1.3455,
"mean_token_accuracy": 0.683870941400528,
"num_tokens": 10523519.0,
"step": 226
},
{
"epoch": 2.8789808917197455,
"grad_norm": 0.3587774336338043,
"learning_rate": 0.0001323664571725764,
"loss": 1.3114,
"mean_token_accuracy": 0.6917595863342285,
"num_tokens": 10569542.0,
"step": 227
},
{
"epoch": 2.8917197452229297,
"grad_norm": 0.356501042842865,
"learning_rate": 0.00013180398297650393,
"loss": 1.2964,
"mean_token_accuracy": 0.6952946484088898,
"num_tokens": 10614027.0,
"step": 228
},
{
"epoch": 2.904458598726115,
"grad_norm": 0.35891181230545044,
"learning_rate": 0.00013124038710130722,
"loss": 1.3163,
"mean_token_accuracy": 0.6918761730194092,
"num_tokens": 10658379.0,
"step": 229
},
{
"epoch": 2.917197452229299,
"grad_norm": 0.3601120412349701,
"learning_rate": 0.00013067568942417356,
"loss": 1.3088,
"mean_token_accuracy": 0.6909421980381012,
"num_tokens": 10704697.0,
"step": 230
},
{
"epoch": 2.9299363057324843,
"grad_norm": 0.3705814778804779,
"learning_rate": 0.00013010990986114926,
"loss": 1.3429,
"mean_token_accuracy": 0.686343640089035,
"num_tokens": 10749941.0,
"step": 231
},
{
"epoch": 2.9426751592356686,
"grad_norm": 0.3506789207458496,
"learning_rate": 0.00012954306836643703,
"loss": 1.3814,
"mean_token_accuracy": 0.681389331817627,
"num_tokens": 10799643.0,
"step": 232
},
{
"epoch": 2.9554140127388537,
"grad_norm": 0.35677486658096313,
"learning_rate": 0.0001289751849316924,
"loss": 1.3094,
"mean_token_accuracy": 0.6908452808856964,
"num_tokens": 10846595.0,
"step": 233
},
{
"epoch": 2.968152866242038,
"grad_norm": 0.35693496465682983,
"learning_rate": 0.0001284062795853185,
"loss": 1.3572,
"mean_token_accuracy": 0.6837401986122131,
"num_tokens": 10892579.0,
"step": 234
},
{
"epoch": 2.980891719745223,
"grad_norm": 0.3480221927165985,
"learning_rate": 0.00012783637239175994,
"loss": 1.3716,
"mean_token_accuracy": 0.6815778911113739,
"num_tokens": 10941192.0,
"step": 235
},
{
"epoch": 2.9936305732484074,
"grad_norm": 0.35607731342315674,
"learning_rate": 0.00012726548345079475,
"loss": 1.2997,
"mean_token_accuracy": 0.6946380734443665,
"num_tokens": 10988163.0,
"step": 236
},
{
"epoch": 3.0,
"grad_norm": 0.35607731342315674,
"learning_rate": 0.00012669363289682584,
"loss": 1.1714,
"mean_token_accuracy": 0.7204415202140808,
"num_tokens": 11011750.0,
"step": 237
},
{
"epoch": 3.0127388535031847,
"grad_norm": 0.575162947177887,
"learning_rate": 0.0001261208408981708,
"loss": 1.0975,
"mean_token_accuracy": 0.7386822700500488,
"num_tokens": 11059787.0,
"step": 238
},
{
"epoch": 3.0254777070063694,
"grad_norm": 0.4076228737831116,
"learning_rate": 0.00012554712765635057,
"loss": 1.0699,
"mean_token_accuracy": 0.7432563006877899,
"num_tokens": 11104750.0,
"step": 239
},
{
"epoch": 3.038216560509554,
"grad_norm": 0.3734162747859955,
"learning_rate": 0.0001249725134053769,
"loss": 1.0605,
"mean_token_accuracy": 0.7436703443527222,
"num_tokens": 11150757.0,
"step": 240
},
{
"epoch": 3.050955414012739,
"grad_norm": 0.40389564633369446,
"learning_rate": 0.00012439701841103888,
"loss": 1.0362,
"mean_token_accuracy": 0.7471202611923218,
"num_tokens": 11200823.0,
"step": 241
},
{
"epoch": 3.0636942675159236,
"grad_norm": 0.5040764212608337,
"learning_rate": 0.00012382066297018804,
"loss": 1.0947,
"mean_token_accuracy": 0.7376525700092316,
"num_tokens": 11247910.0,
"step": 242
},
{
"epoch": 3.0764331210191083,
"grad_norm": 0.5463912487030029,
"learning_rate": 0.0001232434674100226,
"loss": 1.0766,
"mean_token_accuracy": 0.739810049533844,
"num_tokens": 11294764.0,
"step": 243
},
{
"epoch": 3.089171974522293,
"grad_norm": 0.47988808155059814,
"learning_rate": 0.00012266545208737054,
"loss": 1.0322,
"mean_token_accuracy": 0.7498438358306885,
"num_tokens": 11341044.0,
"step": 244
},
{
"epoch": 3.1019108280254777,
"grad_norm": 0.4334051311016083,
"learning_rate": 0.00012208663738797165,
"loss": 1.0363,
"mean_token_accuracy": 0.7506378591060638,
"num_tokens": 11387746.0,
"step": 245
},
{
"epoch": 3.1146496815286624,
"grad_norm": 0.39998453855514526,
"learning_rate": 0.00012150704372575854,
"loss": 1.06,
"mean_token_accuracy": 0.7452342510223389,
"num_tokens": 11436154.0,
"step": 246
},
{
"epoch": 3.127388535031847,
"grad_norm": 0.3928165137767792,
"learning_rate": 0.00012092669154213665,
"loss": 0.9898,
"mean_token_accuracy": 0.7584972083568573,
"num_tokens": 11481728.0,
"step": 247
},
{
"epoch": 3.140127388535032,
"grad_norm": 0.40028896927833557,
"learning_rate": 0.0001203456013052634,
"loss": 1.0131,
"mean_token_accuracy": 0.7529804110527039,
"num_tokens": 11527633.0,
"step": 248
},
{
"epoch": 3.1528662420382165,
"grad_norm": 0.410742849111557,
"learning_rate": 0.00011976379350932618,
"loss": 1.0296,
"mean_token_accuracy": 0.7526900470256805,
"num_tokens": 11571058.0,
"step": 249
},
{
"epoch": 3.1656050955414012,
"grad_norm": 0.46235859394073486,
"learning_rate": 0.00011918128867381965,
"loss": 1.0359,
"mean_token_accuracy": 0.7495845854282379,
"num_tokens": 11616706.0,
"step": 250
},
{
"epoch": 3.178343949044586,
"grad_norm": 0.4445168673992157,
"learning_rate": 0.00011859810734282208,
"loss": 1.0576,
"mean_token_accuracy": 0.7440116107463837,
"num_tokens": 11663486.0,
"step": 251
},
{
"epoch": 3.1910828025477707,
"grad_norm": 0.4728211462497711,
"learning_rate": 0.00011801427008427063,
"loss": 1.0368,
"mean_token_accuracy": 0.7495954632759094,
"num_tokens": 11708088.0,
"step": 252
},
{
"epoch": 3.2038216560509554,
"grad_norm": 0.4592626690864563,
"learning_rate": 0.00011742979748923611,
"loss": 1.0344,
"mean_token_accuracy": 0.7493532598018646,
"num_tokens": 11753940.0,
"step": 253
},
{
"epoch": 3.21656050955414,
"grad_norm": 0.46383729577064514,
"learning_rate": 0.00011684471017119667,
"loss": 1.0031,
"mean_token_accuracy": 0.7553220391273499,
"num_tokens": 11800640.0,
"step": 254
},
{
"epoch": 3.229299363057325,
"grad_norm": 0.44475027918815613,
"learning_rate": 0.00011625902876531082,
"loss": 1.0085,
"mean_token_accuracy": 0.7538060247898102,
"num_tokens": 11847227.0,
"step": 255
},
{
"epoch": 3.2420382165605095,
"grad_norm": 0.4252687990665436,
"learning_rate": 0.00011567277392768972,
"loss": 1.1065,
"mean_token_accuracy": 0.7358538806438446,
"num_tokens": 11897270.0,
"step": 256
},
{
"epoch": 3.254777070063694,
"grad_norm": 0.4112376272678375,
"learning_rate": 0.00011508596633466852,
"loss": 1.0294,
"mean_token_accuracy": 0.7512390911579132,
"num_tokens": 11943975.0,
"step": 257
},
{
"epoch": 3.267515923566879,
"grad_norm": 0.42077869176864624,
"learning_rate": 0.00011449862668207734,
"loss": 1.0362,
"mean_token_accuracy": 0.7497402131557465,
"num_tokens": 11990344.0,
"step": 258
},
{
"epoch": 3.2802547770700636,
"grad_norm": 0.4334986209869385,
"learning_rate": 0.00011391077568451116,
"loss": 1.0238,
"mean_token_accuracy": 0.7498055994510651,
"num_tokens": 12036618.0,
"step": 259
},
{
"epoch": 3.2929936305732483,
"grad_norm": 0.42075401544570923,
"learning_rate": 0.0001133224340745994,
"loss": 1.0022,
"mean_token_accuracy": 0.754104495048523,
"num_tokens": 12081719.0,
"step": 260
},
{
"epoch": 3.305732484076433,
"grad_norm": 0.4563131034374237,
"learning_rate": 0.00011273362260227458,
"loss": 1.0512,
"mean_token_accuracy": 0.7474367916584015,
"num_tokens": 12128789.0,
"step": 261
},
{
"epoch": 3.3184713375796178,
"grad_norm": 0.4512925446033478,
"learning_rate": 0.00011214436203404062,
"loss": 1.0496,
"mean_token_accuracy": 0.7442962825298309,
"num_tokens": 12177227.0,
"step": 262
},
{
"epoch": 3.3312101910828025,
"grad_norm": 0.4189808964729309,
"learning_rate": 0.00011155467315224038,
"loss": 1.0589,
"mean_token_accuracy": 0.7440447509288788,
"num_tokens": 12226380.0,
"step": 263
},
{
"epoch": 3.343949044585987,
"grad_norm": 0.42184701561927795,
"learning_rate": 0.00011096457675432266,
"loss": 1.0399,
"mean_token_accuracy": 0.7482756078243256,
"num_tokens": 12275760.0,
"step": 264
},
{
"epoch": 3.356687898089172,
"grad_norm": 0.4403589963912964,
"learning_rate": 0.0001103740936521088,
"loss": 1.0571,
"mean_token_accuracy": 0.7462457716464996,
"num_tokens": 12324908.0,
"step": 265
},
{
"epoch": 3.3694267515923566,
"grad_norm": 0.4608840346336365,
"learning_rate": 0.00010978324467105858,
"loss": 1.0259,
"mean_token_accuracy": 0.7492176592350006,
"num_tokens": 12369407.0,
"step": 266
},
{
"epoch": 3.3821656050955413,
"grad_norm": 0.443196177482605,
"learning_rate": 0.00010919205064953582,
"loss": 1.0489,
"mean_token_accuracy": 0.7451373040676117,
"num_tokens": 12416757.0,
"step": 267
},
{
"epoch": 3.394904458598726,
"grad_norm": 0.41043445467948914,
"learning_rate": 0.00010860053243807338,
"loss": 1.0468,
"mean_token_accuracy": 0.7448963224887848,
"num_tokens": 12467082.0,
"step": 268
},
{
"epoch": 3.4076433121019107,
"grad_norm": 0.439742773771286,
"learning_rate": 0.00010800871089863785,
"loss": 1.0377,
"mean_token_accuracy": 0.7474401891231537,
"num_tokens": 12512084.0,
"step": 269
},
{
"epoch": 3.4203821656050954,
"grad_norm": 0.4662080407142639,
"learning_rate": 0.00010741660690389365,
"loss": 1.0456,
"mean_token_accuracy": 0.7488239109516144,
"num_tokens": 12557743.0,
"step": 270
},
{
"epoch": 3.43312101910828,
"grad_norm": 0.45201772451400757,
"learning_rate": 0.0001068242413364671,
"loss": 1.0273,
"mean_token_accuracy": 0.7499560117721558,
"num_tokens": 12603687.0,
"step": 271
},
{
"epoch": 3.445859872611465,
"grad_norm": 0.424855500459671,
"learning_rate": 0.00010623163508820977,
"loss": 1.0008,
"mean_token_accuracy": 0.7553302347660065,
"num_tokens": 12648954.0,
"step": 272
},
{
"epoch": 3.4585987261146496,
"grad_norm": 0.4551679790019989,
"learning_rate": 0.00010563880905946159,
"loss": 1.0301,
"mean_token_accuracy": 0.7494941651821136,
"num_tokens": 12692342.0,
"step": 273
},
{
"epoch": 3.4713375796178343,
"grad_norm": 0.46419814229011536,
"learning_rate": 0.00010504578415831395,
"loss": 1.0583,
"mean_token_accuracy": 0.7461420893669128,
"num_tokens": 12737321.0,
"step": 274
},
{
"epoch": 3.484076433121019,
"grad_norm": 0.4456294775009155,
"learning_rate": 0.00010445258129987206,
"loss": 1.0406,
"mean_token_accuracy": 0.7484328746795654,
"num_tokens": 12784140.0,
"step": 275
},
{
"epoch": 3.4968152866242037,
"grad_norm": 0.4584999978542328,
"learning_rate": 0.00010385922140551752,
"loss": 1.0348,
"mean_token_accuracy": 0.7499430775642395,
"num_tokens": 12830314.0,
"step": 276
},
{
"epoch": 3.5095541401273884,
"grad_norm": 0.44610586762428284,
"learning_rate": 0.00010326572540217028,
"loss": 1.0534,
"mean_token_accuracy": 0.747410923242569,
"num_tokens": 12877459.0,
"step": 277
},
{
"epoch": 3.522292993630573,
"grad_norm": 0.48907381296157837,
"learning_rate": 0.00010267211422155072,
"loss": 1.0698,
"mean_token_accuracy": 0.7433335781097412,
"num_tokens": 12923562.0,
"step": 278
},
{
"epoch": 3.535031847133758,
"grad_norm": 0.4395643174648285,
"learning_rate": 0.00010207840879944123,
"loss": 1.0296,
"mean_token_accuracy": 0.7491806745529175,
"num_tokens": 12971195.0,
"step": 279
},
{
"epoch": 3.5477707006369426,
"grad_norm": 0.445525586605072,
"learning_rate": 0.0001014846300749481,
"loss": 1.0634,
"mean_token_accuracy": 0.7422992885112762,
"num_tokens": 13018111.0,
"step": 280
},
{
"epoch": 3.5605095541401273,
"grad_norm": 0.44029030203819275,
"learning_rate": 0.00010089079898976284,
"loss": 1.0845,
"mean_token_accuracy": 0.7385657727718353,
"num_tokens": 13065801.0,
"step": 281
},
{
"epoch": 3.573248407643312,
"grad_norm": 0.4442991614341736,
"learning_rate": 0.00010029693648742355,
"loss": 1.0247,
"mean_token_accuracy": 0.7507951855659485,
"num_tokens": 13110544.0,
"step": 282
},
{
"epoch": 3.5859872611464967,
"grad_norm": 0.4595116972923279,
"learning_rate": 9.970306351257647e-05,
"loss": 1.0714,
"mean_token_accuracy": 0.7425291538238525,
"num_tokens": 13159700.0,
"step": 283
},
{
"epoch": 3.5987261146496814,
"grad_norm": 0.42567887902259827,
"learning_rate": 9.910920101023717e-05,
"loss": 1.0511,
"mean_token_accuracy": 0.7453266978263855,
"num_tokens": 13208331.0,
"step": 284
},
{
"epoch": 3.611464968152866,
"grad_norm": 0.43944114446640015,
"learning_rate": 9.851536992505188e-05,
"loss": 1.0418,
"mean_token_accuracy": 0.7464134097099304,
"num_tokens": 13255087.0,
"step": 285
},
{
"epoch": 3.624203821656051,
"grad_norm": 0.44316551089286804,
"learning_rate": 9.79215912005588e-05,
"loss": 1.0306,
"mean_token_accuracy": 0.7519051730632782,
"num_tokens": 13301979.0,
"step": 286
},
{
"epoch": 3.6369426751592355,
"grad_norm": 0.46782058477401733,
"learning_rate": 9.732788577844934e-05,
"loss": 1.0267,
"mean_token_accuracy": 0.7499517202377319,
"num_tokens": 13346264.0,
"step": 287
},
{
"epoch": 3.6496815286624202,
"grad_norm": 0.4449765682220459,
"learning_rate": 9.673427459782974e-05,
"loss": 1.0627,
"mean_token_accuracy": 0.7452774345874786,
"num_tokens": 13395122.0,
"step": 288
},
{
"epoch": 3.662420382165605,
"grad_norm": 0.44802337884902954,
"learning_rate": 9.61407785944825e-05,
"loss": 1.0381,
"mean_token_accuracy": 0.7449367344379425,
"num_tokens": 13441560.0,
"step": 289
},
{
"epoch": 3.6751592356687897,
"grad_norm": 0.47226378321647644,
"learning_rate": 9.554741870012797e-05,
"loss": 1.061,
"mean_token_accuracy": 0.7463669776916504,
"num_tokens": 13485397.0,
"step": 290
},
{
"epoch": 3.6878980891719744,
"grad_norm": 0.4418249726295471,
"learning_rate": 9.495421584168609e-05,
"loss": 1.0429,
"mean_token_accuracy": 0.7469217479228973,
"num_tokens": 13533561.0,
"step": 291
},
{
"epoch": 3.700636942675159,
"grad_norm": 0.43316134810447693,
"learning_rate": 9.436119094053846e-05,
"loss": 1.0496,
"mean_token_accuracy": 0.7461331188678741,
"num_tokens": 13579401.0,
"step": 292
},
{
"epoch": 3.713375796178344,
"grad_norm": 0.4408023953437805,
"learning_rate": 9.376836491179028e-05,
"loss": 1.0554,
"mean_token_accuracy": 0.7451147735118866,
"num_tokens": 13626917.0,
"step": 293
},
{
"epoch": 3.7261146496815285,
"grad_norm": 0.47314339876174927,
"learning_rate": 9.317575866353292e-05,
"loss": 1.0349,
"mean_token_accuracy": 0.7479163408279419,
"num_tokens": 13669796.0,
"step": 294
},
{
"epoch": 3.738853503184713,
"grad_norm": 0.45513227581977844,
"learning_rate": 9.258339309610637e-05,
"loss": 1.063,
"mean_token_accuracy": 0.7429400384426117,
"num_tokens": 13717064.0,
"step": 295
},
{
"epoch": 3.7515923566878984,
"grad_norm": 0.44753924012184143,
"learning_rate": 9.199128910136219e-05,
"loss": 1.014,
"mean_token_accuracy": 0.7514563202857971,
"num_tokens": 13763993.0,
"step": 296
},
{
"epoch": 3.7643312101910826,
"grad_norm": 0.4445459246635437,
"learning_rate": 9.139946756192663e-05,
"loss": 1.0219,
"mean_token_accuracy": 0.7516200542449951,
"num_tokens": 13810226.0,
"step": 297
},
{
"epoch": 3.777070063694268,
"grad_norm": 0.4555498957633972,
"learning_rate": 9.080794935046421e-05,
"loss": 1.0846,
"mean_token_accuracy": 0.737242728471756,
"num_tokens": 13859627.0,
"step": 298
},
{
"epoch": 3.789808917197452,
"grad_norm": 0.4423632323741913,
"learning_rate": 9.021675532894145e-05,
"loss": 1.0149,
"mean_token_accuracy": 0.7535317242145538,
"num_tokens": 13904621.0,
"step": 299
},
{
"epoch": 3.802547770700637,
"grad_norm": 0.4562549293041229,
"learning_rate": 8.962590634789123e-05,
"loss": 1.0274,
"mean_token_accuracy": 0.7515223622322083,
"num_tokens": 13951418.0,
"step": 300
},
{
"epoch": 3.8152866242038215,
"grad_norm": 0.4509284198284149,
"learning_rate": 8.903542324567736e-05,
"loss": 1.0512,
"mean_token_accuracy": 0.7477030754089355,
"num_tokens": 13996941.0,
"step": 301
},
{
"epoch": 3.8280254777070066,
"grad_norm": 0.4827808737754822,
"learning_rate": 8.844532684775963e-05,
"loss": 0.9791,
"mean_token_accuracy": 0.7602791786193848,
"num_tokens": 14041820.0,
"step": 302
},
{
"epoch": 3.840764331210191,
"grad_norm": 0.46509167551994324,
"learning_rate": 8.785563796595938e-05,
"loss": 1.0442,
"mean_token_accuracy": 0.7479641735553741,
"num_tokens": 14089905.0,
"step": 303
},
{
"epoch": 3.853503184713376,
"grad_norm": 0.4547942876815796,
"learning_rate": 8.726637739772542e-05,
"loss": 1.0554,
"mean_token_accuracy": 0.7465295493602753,
"num_tokens": 14135065.0,
"step": 304
},
{
"epoch": 3.8662420382165603,
"grad_norm": 0.4469335675239563,
"learning_rate": 8.667756592540064e-05,
"loss": 1.0383,
"mean_token_accuracy": 0.7464892268180847,
"num_tokens": 14179255.0,
"step": 305
},
{
"epoch": 3.8789808917197455,
"grad_norm": 0.45058006048202515,
"learning_rate": 8.608922431548887e-05,
"loss": 1.0453,
"mean_token_accuracy": 0.7463506460189819,
"num_tokens": 14228844.0,
"step": 306
},
{
"epoch": 3.8917197452229297,
"grad_norm": 0.44601333141326904,
"learning_rate": 8.55013733179227e-05,
"loss": 1.0407,
"mean_token_accuracy": 0.7497325539588928,
"num_tokens": 14274709.0,
"step": 307
},
{
"epoch": 3.904458598726115,
"grad_norm": 0.44497182965278625,
"learning_rate": 8.49140336653315e-05,
"loss": 1.0158,
"mean_token_accuracy": 0.7533020973205566,
"num_tokens": 14321597.0,
"step": 308
},
{
"epoch": 3.917197452229299,
"grad_norm": 0.43743929266929626,
"learning_rate": 8.43272260723103e-05,
"loss": 1.0137,
"mean_token_accuracy": 0.7568092048168182,
"num_tokens": 14369925.0,
"step": 309
},
{
"epoch": 3.9299363057324843,
"grad_norm": 0.44671833515167236,
"learning_rate": 8.374097123468918e-05,
"loss": 1.0583,
"mean_token_accuracy": 0.7409914433956146,
"num_tokens": 14417628.0,
"step": 310
},
{
"epoch": 3.9426751592356686,
"grad_norm": 0.44011715054512024,
"learning_rate": 8.315528982880337e-05,
"loss": 1.0307,
"mean_token_accuracy": 0.7483357191085815,
"num_tokens": 14466473.0,
"step": 311
},
{
"epoch": 3.9554140127388537,
"grad_norm": 0.45142441987991333,
"learning_rate": 8.257020251076393e-05,
"loss": 1.0565,
"mean_token_accuracy": 0.7446093857288361,
"num_tokens": 14512510.0,
"step": 312
},
{
"epoch": 3.968152866242038,
"grad_norm": 0.48025238513946533,
"learning_rate": 8.198572991572939e-05,
"loss": 1.0597,
"mean_token_accuracy": 0.7435389757156372,
"num_tokens": 14561087.0,
"step": 313
},
{
"epoch": 3.980891719745223,
"grad_norm": 0.45641523599624634,
"learning_rate": 8.140189265717794e-05,
"loss": 1.0903,
"mean_token_accuracy": 0.739763617515564,
"num_tokens": 14610134.0,
"step": 314
},
{
"epoch": 3.9936305732484074,
"grad_norm": 0.4491109848022461,
"learning_rate": 8.081871132618036e-05,
"loss": 1.0839,
"mean_token_accuracy": 0.7389968633651733,
"num_tokens": 14659750.0,
"step": 315
},
{
"epoch": 4.0,
"grad_norm": 0.6807467937469482,
"learning_rate": 8.023620649067384e-05,
"loss": 0.9348,
"mean_token_accuracy": 0.7736132740974426,
"num_tokens": 14683741.0,
"step": 316
},
{
"epoch": 4.012738853503185,
"grad_norm": 0.46182575821876526,
"learning_rate": 7.965439869473664e-05,
"loss": 0.8458,
"mean_token_accuracy": 0.7974231243133545,
"num_tokens": 14731484.0,
"step": 317
},
{
"epoch": 4.025477707006369,
"grad_norm": 0.4779008626937866,
"learning_rate": 7.907330845786337e-05,
"loss": 0.82,
"mean_token_accuracy": 0.8037229180335999,
"num_tokens": 14776906.0,
"step": 318
},
{
"epoch": 4.038216560509555,
"grad_norm": 0.47625744342803955,
"learning_rate": 7.849295627424148e-05,
"loss": 0.791,
"mean_token_accuracy": 0.8079457581043243,
"num_tokens": 14822669.0,
"step": 319
},
{
"epoch": 4.050955414012739,
"grad_norm": 0.5156582593917847,
"learning_rate": 7.791336261202835e-05,
"loss": 0.7787,
"mean_token_accuracy": 0.8072306513786316,
"num_tokens": 14869201.0,
"step": 320
},
{
"epoch": 4.063694267515924,
"grad_norm": 0.6505507826805115,
"learning_rate": 7.733454791262947e-05,
"loss": 0.774,
"mean_token_accuracy": 0.8075048327445984,
"num_tokens": 14916197.0,
"step": 321
},
{
"epoch": 4.076433121019108,
"grad_norm": 0.7211319208145142,
"learning_rate": 7.67565325899774e-05,
"loss": 0.7775,
"mean_token_accuracy": 0.8053169548511505,
"num_tokens": 14962850.0,
"step": 322
},
{
"epoch": 4.089171974522293,
"grad_norm": 0.6594023108482361,
"learning_rate": 7.617933702981198e-05,
"loss": 0.7764,
"mean_token_accuracy": 0.8061047494411469,
"num_tokens": 15011258.0,
"step": 323
},
{
"epoch": 4.101910828025478,
"grad_norm": 0.6146224737167358,
"learning_rate": 7.560298158896114e-05,
"loss": 0.7769,
"mean_token_accuracy": 0.8081805408000946,
"num_tokens": 15056644.0,
"step": 324
},
{
"epoch": 4.114649681528663,
"grad_norm": 0.5424087047576904,
"learning_rate": 7.502748659462311e-05,
"loss": 0.7706,
"mean_token_accuracy": 0.8129306137561798,
"num_tokens": 15102628.0,
"step": 325
},
{
"epoch": 4.127388535031847,
"grad_norm": 0.5145137310028076,
"learning_rate": 7.445287234364946e-05,
"loss": 0.7846,
"mean_token_accuracy": 0.8085419535636902,
"num_tokens": 15147902.0,
"step": 326
},
{
"epoch": 4.140127388535032,
"grad_norm": 0.5234518051147461,
"learning_rate": 7.38791591018292e-05,
"loss": 0.765,
"mean_token_accuracy": 0.8127568960189819,
"num_tokens": 15191402.0,
"step": 327
},
{
"epoch": 4.1528662420382165,
"grad_norm": 0.5007306933403015,
"learning_rate": 7.330636710317417e-05,
"loss": 0.8103,
"mean_token_accuracy": 0.8035311698913574,
"num_tokens": 15237737.0,
"step": 328
},
{
"epoch": 4.165605095541402,
"grad_norm": 0.517250120639801,
"learning_rate": 7.273451654920532e-05,
"loss": 0.7801,
"mean_token_accuracy": 0.8110656440258026,
"num_tokens": 15284311.0,
"step": 329
},
{
"epoch": 4.178343949044586,
"grad_norm": 0.5196605920791626,
"learning_rate": 7.21636276082401e-05,
"loss": 0.7937,
"mean_token_accuracy": 0.8047934472560883,
"num_tokens": 15330798.0,
"step": 330
},
{
"epoch": 4.191082802547771,
"grad_norm": 0.5460777878761292,
"learning_rate": 7.15937204146815e-05,
"loss": 0.8176,
"mean_token_accuracy": 0.8022070527076721,
"num_tokens": 15378878.0,
"step": 331
},
{
"epoch": 4.203821656050955,
"grad_norm": 0.5694323778152466,
"learning_rate": 7.102481506830764e-05,
"loss": 0.8123,
"mean_token_accuracy": 0.8015323579311371,
"num_tokens": 15425749.0,
"step": 332
},
{
"epoch": 4.2165605095541405,
"grad_norm": 0.55637127161026,
"learning_rate": 7.0456931633563e-05,
"loss": 0.7753,
"mean_token_accuracy": 0.8087098598480225,
"num_tokens": 15472222.0,
"step": 333
},
{
"epoch": 4.229299363057325,
"grad_norm": 0.5772049427032471,
"learning_rate": 6.989009013885077e-05,
"loss": 0.7884,
"mean_token_accuracy": 0.8073362112045288,
"num_tokens": 15521012.0,
"step": 334
},
{
"epoch": 4.24203821656051,
"grad_norm": 0.5783923268318176,
"learning_rate": 6.932431057582647e-05,
"loss": 0.7451,
"mean_token_accuracy": 0.8135620653629303,
"num_tokens": 15566485.0,
"step": 335
},
{
"epoch": 4.254777070063694,
"grad_norm": 0.5757331252098083,
"learning_rate": 6.875961289869283e-05,
"loss": 0.7487,
"mean_token_accuracy": 0.8147032558917999,
"num_tokens": 15612600.0,
"step": 336
},
{
"epoch": 4.267515923566879,
"grad_norm": 0.5666617751121521,
"learning_rate": 6.819601702349609e-05,
"loss": 0.7653,
"mean_token_accuracy": 0.810498058795929,
"num_tokens": 15658443.0,
"step": 337
},
{
"epoch": 4.280254777070064,
"grad_norm": 0.54319828748703,
"learning_rate": 6.763354282742363e-05,
"loss": 0.7754,
"mean_token_accuracy": 0.8075751662254333,
"num_tokens": 15706012.0,
"step": 338
},
{
"epoch": 4.292993630573249,
"grad_norm": 0.5346329212188721,
"learning_rate": 6.707221014810279e-05,
"loss": 0.7588,
"mean_token_accuracy": 0.812885046005249,
"num_tokens": 15752588.0,
"step": 339
},
{
"epoch": 4.305732484076433,
"grad_norm": 0.5441272258758545,
"learning_rate": 6.651203878290139e-05,
"loss": 0.7827,
"mean_token_accuracy": 0.8059158623218536,
"num_tokens": 15798766.0,
"step": 340
},
{
"epoch": 4.318471337579618,
"grad_norm": 0.5370075106620789,
"learning_rate": 6.59530484882294e-05,
"loss": 0.8123,
"mean_token_accuracy": 0.8005849421024323,
"num_tokens": 15845861.0,
"step": 341
},
{
"epoch": 4.3312101910828025,
"grad_norm": 0.5364204049110413,
"learning_rate": 6.539525897884219e-05,
"loss": 0.7945,
"mean_token_accuracy": 0.8061460852622986,
"num_tokens": 15891605.0,
"step": 342
},
{
"epoch": 4.343949044585988,
"grad_norm": 0.5339395403862,
"learning_rate": 6.48386899271452e-05,
"loss": 0.8008,
"mean_token_accuracy": 0.8012154996395111,
"num_tokens": 15940667.0,
"step": 343
},
{
"epoch": 4.356687898089172,
"grad_norm": 0.5205627083778381,
"learning_rate": 6.428336096250019e-05,
"loss": 0.7537,
"mean_token_accuracy": 0.8153076469898224,
"num_tokens": 15987561.0,
"step": 344
},
{
"epoch": 4.369426751592357,
"grad_norm": 0.5304903388023376,
"learning_rate": 6.372929167053286e-05,
"loss": 0.7702,
"mean_token_accuracy": 0.809718132019043,
"num_tokens": 16034176.0,
"step": 345
},
{
"epoch": 4.382165605095541,
"grad_norm": 0.5487926602363586,
"learning_rate": 6.317650159244212e-05,
"loss": 0.7613,
"mean_token_accuracy": 0.8127056956291199,
"num_tokens": 16082008.0,
"step": 346
},
{
"epoch": 4.3949044585987265,
"grad_norm": 0.5397400856018066,
"learning_rate": 6.2625010224311e-05,
"loss": 0.767,
"mean_token_accuracy": 0.8101482689380646,
"num_tokens": 16127461.0,
"step": 347
},
{
"epoch": 4.407643312101911,
"grad_norm": 0.5537377595901489,
"learning_rate": 6.207483701641888e-05,
"loss": 0.7713,
"mean_token_accuracy": 0.8083570003509521,
"num_tokens": 16173594.0,
"step": 348
},
{
"epoch": 4.420382165605096,
"grad_norm": 0.5595129728317261,
"learning_rate": 6.15260013725555e-05,
"loss": 0.7617,
"mean_token_accuracy": 0.8116026222705841,
"num_tokens": 16218042.0,
"step": 349
},
{
"epoch": 4.43312101910828,
"grad_norm": 0.5709227323532104,
"learning_rate": 6.097852264933697e-05,
"loss": 0.7986,
"mean_token_accuracy": 0.8036070764064789,
"num_tokens": 16264765.0,
"step": 350
},
{
"epoch": 4.445859872611465,
"grad_norm": 0.5528348684310913,
"learning_rate": 6.043242015552258e-05,
"loss": 0.7754,
"mean_token_accuracy": 0.8096699416637421,
"num_tokens": 16311474.0,
"step": 351
},
{
"epoch": 4.45859872611465,
"grad_norm": 0.5509300827980042,
"learning_rate": 5.988771315133418e-05,
"loss": 0.7629,
"mean_token_accuracy": 0.812688410282135,
"num_tokens": 16359002.0,
"step": 352
},
{
"epoch": 4.471337579617835,
"grad_norm": 0.5490424633026123,
"learning_rate": 5.934442084777676e-05,
"loss": 0.7771,
"mean_token_accuracy": 0.8061512410640717,
"num_tokens": 16407048.0,
"step": 353
},
{
"epoch": 4.484076433121019,
"grad_norm": 0.5424743294715881,
"learning_rate": 5.880256240596096e-05,
"loss": 0.7625,
"mean_token_accuracy": 0.811147153377533,
"num_tokens": 16453863.0,
"step": 354
},
{
"epoch": 4.496815286624204,
"grad_norm": 0.5359919667243958,
"learning_rate": 5.8262156936427096e-05,
"loss": 0.7985,
"mean_token_accuracy": 0.8056308627128601,
"num_tokens": 16502333.0,
"step": 355
},
{
"epoch": 4.509554140127388,
"grad_norm": 0.5353891253471375,
"learning_rate": 5.772322349847154e-05,
"loss": 0.7774,
"mean_token_accuracy": 0.8094648122787476,
"num_tokens": 16549278.0,
"step": 356
},
{
"epoch": 4.522292993630574,
"grad_norm": 0.5505733489990234,
"learning_rate": 5.71857810994741e-05,
"loss": 0.7633,
"mean_token_accuracy": 0.8114041388034821,
"num_tokens": 16595007.0,
"step": 357
},
{
"epoch": 4.535031847133758,
"grad_norm": 0.5385571122169495,
"learning_rate": 5.6649848694228026e-05,
"loss": 0.7829,
"mean_token_accuracy": 0.8066455721855164,
"num_tokens": 16642899.0,
"step": 358
},
{
"epoch": 4.547770700636943,
"grad_norm": 0.5487037301063538,
"learning_rate": 5.611544518427121e-05,
"loss": 0.7427,
"mean_token_accuracy": 0.8148898184299469,
"num_tokens": 16687593.0,
"step": 359
},
{
"epoch": 4.560509554140127,
"grad_norm": 0.5425994396209717,
"learning_rate": 5.558258941721982e-05,
"loss": 0.7872,
"mean_token_accuracy": 0.8057865798473358,
"num_tokens": 16737104.0,
"step": 360
},
{
"epoch": 4.573248407643312,
"grad_norm": 0.5299367904663086,
"learning_rate": 5.5051300186103214e-05,
"loss": 0.7353,
"mean_token_accuracy": 0.8165575265884399,
"num_tokens": 16782471.0,
"step": 361
},
{
"epoch": 4.585987261146497,
"grad_norm": 0.5561987161636353,
"learning_rate": 5.452159622870158e-05,
"loss": 0.7256,
"mean_token_accuracy": 0.8211332857608795,
"num_tokens": 16824795.0,
"step": 362
},
{
"epoch": 4.598726114649682,
"grad_norm": 0.5320610404014587,
"learning_rate": 5.399349622688479e-05,
"loss": 0.7847,
"mean_token_accuracy": 0.806152880191803,
"num_tokens": 16873618.0,
"step": 363
},
{
"epoch": 4.611464968152866,
"grad_norm": 0.5142655968666077,
"learning_rate": 5.346701880595354e-05,
"loss": 0.768,
"mean_token_accuracy": 0.8106401562690735,
"num_tokens": 16921852.0,
"step": 364
},
{
"epoch": 4.624203821656051,
"grad_norm": 0.5498877763748169,
"learning_rate": 5.29421825339826e-05,
"loss": 0.7585,
"mean_token_accuracy": 0.8139531016349792,
"num_tokens": 16968343.0,
"step": 365
},
{
"epoch": 4.6369426751592355,
"grad_norm": 0.5473263263702393,
"learning_rate": 5.24190059211658e-05,
"loss": 0.7421,
"mean_token_accuracy": 0.8171448707580566,
"num_tokens": 17012314.0,
"step": 366
},
{
"epoch": 4.649681528662421,
"grad_norm": 0.545117199420929,
"learning_rate": 5.189750741916326e-05,
"loss": 0.7712,
"mean_token_accuracy": 0.8083784878253937,
"num_tokens": 17059162.0,
"step": 367
},
{
"epoch": 4.662420382165605,
"grad_norm": 0.5788088440895081,
"learning_rate": 5.137770542045063e-05,
"loss": 0.7568,
"mean_token_accuracy": 0.8137945234775543,
"num_tokens": 17103266.0,
"step": 368
},
{
"epoch": 4.67515923566879,
"grad_norm": 0.5412328243255615,
"learning_rate": 5.085961825767049e-05,
"loss": 0.7962,
"mean_token_accuracy": 0.80179163813591,
"num_tokens": 17153007.0,
"step": 369
},
{
"epoch": 4.687898089171974,
"grad_norm": 0.5531262159347534,
"learning_rate": 5.0343264202985575e-05,
"loss": 0.7539,
"mean_token_accuracy": 0.8140422999858856,
"num_tokens": 17197748.0,
"step": 370
},
{
"epoch": 4.7006369426751595,
"grad_norm": 0.554670512676239,
"learning_rate": 4.9828661467434644e-05,
"loss": 0.7965,
"mean_token_accuracy": 0.8047409653663635,
"num_tokens": 17245560.0,
"step": 371
},
{
"epoch": 4.713375796178344,
"grad_norm": 0.5575906038284302,
"learning_rate": 4.93158282002899e-05,
"loss": 0.7646,
"mean_token_accuracy": 0.8107549250125885,
"num_tokens": 17291952.0,
"step": 372
},
{
"epoch": 4.726114649681529,
"grad_norm": 0.5389590263366699,
"learning_rate": 4.8804782488417054e-05,
"loss": 0.8151,
"mean_token_accuracy": 0.8011313676834106,
"num_tokens": 17342344.0,
"step": 373
},
{
"epoch": 4.738853503184713,
"grad_norm": 0.5552359819412231,
"learning_rate": 4.82955423556375e-05,
"loss": 0.7789,
"mean_token_accuracy": 0.8068567216396332,
"num_tokens": 17389806.0,
"step": 374
},
{
"epoch": 4.751592356687898,
"grad_norm": 0.5424468517303467,
"learning_rate": 4.778812576209241e-05,
"loss": 0.7622,
"mean_token_accuracy": 0.8100213408470154,
"num_tokens": 17438195.0,
"step": 375
},
{
"epoch": 4.764331210191083,
"grad_norm": 0.5468940138816833,
"learning_rate": 4.728255060360955e-05,
"loss": 0.7555,
"mean_token_accuracy": 0.8137983977794647,
"num_tokens": 17482935.0,
"step": 376
},
{
"epoch": 4.777070063694268,
"grad_norm": 0.54682457447052,
"learning_rate": 4.677883471107193e-05,
"loss": 0.7665,
"mean_token_accuracy": 0.8110204339027405,
"num_tokens": 17529731.0,
"step": 377
},
{
"epoch": 4.789808917197452,
"grad_norm": 0.5494992136955261,
"learning_rate": 4.6276995849789115e-05,
"loss": 0.7748,
"mean_token_accuracy": 0.8063468039035797,
"num_tokens": 17575732.0,
"step": 378
},
{
"epoch": 4.802547770700637,
"grad_norm": 0.5323486328125,
"learning_rate": 4.57770517188705e-05,
"loss": 0.7762,
"mean_token_accuracy": 0.8069157600402832,
"num_tokens": 17625739.0,
"step": 379
},
{
"epoch": 4.8152866242038215,
"grad_norm": 0.5506855249404907,
"learning_rate": 4.527901995060113e-05,
"loss": 0.7642,
"mean_token_accuracy": 0.8129552602767944,
"num_tokens": 17672179.0,
"step": 380
},
{
"epoch": 4.828025477707007,
"grad_norm": 0.5435847043991089,
"learning_rate": 4.478291810981998e-05,
"loss": 0.7856,
"mean_token_accuracy": 0.8080207407474518,
"num_tokens": 17718571.0,
"step": 381
},
{
"epoch": 4.840764331210191,
"grad_norm": 0.5513826012611389,
"learning_rate": 4.428876369330023e-05,
"loss": 0.7519,
"mean_token_accuracy": 0.8144398927688599,
"num_tokens": 17764089.0,
"step": 382
},
{
"epoch": 4.853503184713376,
"grad_norm": 0.5551168918609619,
"learning_rate": 4.379657412913243e-05,
"loss": 0.8151,
"mean_token_accuracy": 0.8006792664527893,
"num_tokens": 17811590.0,
"step": 383
},
{
"epoch": 4.86624203821656,
"grad_norm": 0.5645202994346619,
"learning_rate": 4.330636677610962e-05,
"loss": 0.7522,
"mean_token_accuracy": 0.8127522766590118,
"num_tokens": 17858948.0,
"step": 384
},
{
"epoch": 4.8789808917197455,
"grad_norm": 0.5622471570968628,
"learning_rate": 4.281815892311525e-05,
"loss": 0.8062,
"mean_token_accuracy": 0.8032259941101074,
"num_tokens": 17908157.0,
"step": 385
},
{
"epoch": 4.89171974522293,
"grad_norm": 0.542911946773529,
"learning_rate": 4.2331967788513295e-05,
"loss": 0.7682,
"mean_token_accuracy": 0.8091734647750854,
"num_tokens": 17954806.0,
"step": 386
},
{
"epoch": 4.904458598726115,
"grad_norm": 0.5518525838851929,
"learning_rate": 4.1847810519541255e-05,
"loss": 0.7999,
"mean_token_accuracy": 0.801593542098999,
"num_tokens": 18004377.0,
"step": 387
},
{
"epoch": 4.917197452229299,
"grad_norm": 0.5533684492111206,
"learning_rate": 4.136570419170501e-05,
"loss": 0.7968,
"mean_token_accuracy": 0.8025395572185516,
"num_tokens": 18052401.0,
"step": 388
},
{
"epoch": 4.929936305732484,
"grad_norm": 0.55246502161026,
"learning_rate": 4.088566580817694e-05,
"loss": 0.7978,
"mean_token_accuracy": 0.8031694889068604,
"num_tokens": 18100024.0,
"step": 389
},
{
"epoch": 4.942675159235669,
"grad_norm": 0.5535824298858643,
"learning_rate": 4.040771229919612e-05,
"loss": 0.7482,
"mean_token_accuracy": 0.8140803873538971,
"num_tokens": 18147924.0,
"step": 390
},
{
"epoch": 4.955414012738854,
"grad_norm": 0.5558858513832092,
"learning_rate": 3.99318605214711e-05,
"loss": 0.7681,
"mean_token_accuracy": 0.8126172721385956,
"num_tokens": 18192564.0,
"step": 391
},
{
"epoch": 4.968152866242038,
"grad_norm": 0.5758087038993835,
"learning_rate": 3.945812725758554e-05,
"loss": 0.7549,
"mean_token_accuracy": 0.8129025399684906,
"num_tokens": 18235174.0,
"step": 392
},
{
"epoch": 4.980891719745223,
"grad_norm": 0.5681016445159912,
"learning_rate": 3.8986529215406275e-05,
"loss": 0.7903,
"mean_token_accuracy": 0.803301215171814,
"num_tokens": 18282949.0,
"step": 393
},
{
"epoch": 4.993630573248407,
"grad_norm": 0.5532224178314209,
"learning_rate": 3.851708302749409e-05,
"loss": 0.8045,
"mean_token_accuracy": 0.801055371761322,
"num_tokens": 18331817.0,
"step": 394
},
{
"epoch": 5.0,
"grad_norm": 0.5532224178314209,
"learning_rate": 3.8049805250517004e-05,
"loss": 0.6807,
"mean_token_accuracy": 0.8316032886505127,
"num_tokens": 18355644.0,
"step": 395
},
{
"epoch": 5.012738853503185,
"grad_norm": 0.803767204284668,
"learning_rate": 3.7584712364666494e-05,
"loss": 0.6007,
"mean_token_accuracy": 0.8561270534992218,
"num_tokens": 18401098.0,
"step": 396
},
{
"epoch": 5.025477707006369,
"grad_norm": 0.5155036449432373,
"learning_rate": 3.71218207730761e-05,
"loss": 0.5801,
"mean_token_accuracy": 0.8610466420650482,
"num_tokens": 18447934.0,
"step": 397
},
{
"epoch": 5.038216560509555,
"grad_norm": 0.5219685435295105,
"learning_rate": 3.666114680124298e-05,
"loss": 0.5532,
"mean_token_accuracy": 0.8671682178974152,
"num_tokens": 18494377.0,
"step": 398
},
{
"epoch": 5.050955414012739,
"grad_norm": 0.5384805798530579,
"learning_rate": 3.620270669645228e-05,
"loss": 0.5539,
"mean_token_accuracy": 0.8648174703121185,
"num_tokens": 18537068.0,
"step": 399
},
{
"epoch": 5.063694267515924,
"grad_norm": 0.5684152841567993,
"learning_rate": 3.574651662720382e-05,
"loss": 0.5738,
"mean_token_accuracy": 0.8580814898014069,
"num_tokens": 18581071.0,
"step": 400
},
{
"epoch": 5.076433121019108,
"grad_norm": 0.6354894638061523,
"learning_rate": 3.5292592682642134e-05,
"loss": 0.5662,
"mean_token_accuracy": 0.8605021834373474,
"num_tokens": 18629826.0,
"step": 401
},
{
"epoch": 5.089171974522293,
"grad_norm": 0.6762036681175232,
"learning_rate": 3.484095087198881e-05,
"loss": 0.5567,
"mean_token_accuracy": 0.8611220121383667,
"num_tokens": 18679551.0,
"step": 402
},
{
"epoch": 5.101910828025478,
"grad_norm": 0.7970669865608215,
"learning_rate": 3.4391607123978095e-05,
"loss": 0.5898,
"mean_token_accuracy": 0.853861540555954,
"num_tokens": 18726481.0,
"step": 403
},
{
"epoch": 5.114649681528663,
"grad_norm": 0.7165261507034302,
"learning_rate": 3.394457728629489e-05,
"loss": 0.5543,
"mean_token_accuracy": 0.8633293807506561,
"num_tokens": 18774675.0,
"step": 404
},
{
"epoch": 5.127388535031847,
"grad_norm": 0.6630553007125854,
"learning_rate": 3.349987712501591e-05,
"loss": 0.5794,
"mean_token_accuracy": 0.8572741746902466,
"num_tokens": 18819968.0,
"step": 405
},
{
"epoch": 5.140127388535032,
"grad_norm": 0.6473745703697205,
"learning_rate": 3.305752232405377e-05,
"loss": 0.5514,
"mean_token_accuracy": 0.8612950146198273,
"num_tokens": 18867168.0,
"step": 406
},
{
"epoch": 5.1528662420382165,
"grad_norm": 0.6203842163085938,
"learning_rate": 3.2617528484603576e-05,
"loss": 0.5792,
"mean_token_accuracy": 0.8582462072372437,
"num_tokens": 18915270.0,
"step": 407
},
{
"epoch": 5.165605095541402,
"grad_norm": 0.632040798664093,
"learning_rate": 3.2179911124592966e-05,
"loss": 0.5655,
"mean_token_accuracy": 0.864041805267334,
"num_tokens": 18961168.0,
"step": 408
},
{
"epoch": 5.178343949044586,
"grad_norm": 0.5363501906394958,
"learning_rate": 3.174468567813461e-05,
"loss": 0.5529,
"mean_token_accuracy": 0.865607500076294,
"num_tokens": 19009217.0,
"step": 409
},
{
"epoch": 5.191082802547771,
"grad_norm": 0.5809481739997864,
"learning_rate": 3.131186749498195e-05,
"loss": 0.5753,
"mean_token_accuracy": 0.8589119017124176,
"num_tokens": 19058035.0,
"step": 410
},
{
"epoch": 5.203821656050955,
"grad_norm": 0.533413290977478,
"learning_rate": 3.088147183998782e-05,
"loss": 0.5756,
"mean_token_accuracy": 0.8603843152523041,
"num_tokens": 19105942.0,
"step": 411
},
{
"epoch": 5.2165605095541405,
"grad_norm": 0.5912073850631714,
"learning_rate": 3.0453513892566197e-05,
"loss": 0.5713,
"mean_token_accuracy": 0.8610886931419373,
"num_tokens": 19149032.0,
"step": 412
},
{
"epoch": 5.229299363057325,
"grad_norm": 0.5597264170646667,
"learning_rate": 3.0028008746156588e-05,
"loss": 0.5593,
"mean_token_accuracy": 0.8630417883396149,
"num_tokens": 19193905.0,
"step": 413
},
{
"epoch": 5.24203821656051,
"grad_norm": 0.5707894563674927,
"learning_rate": 2.9604971407692027e-05,
"loss": 0.5656,
"mean_token_accuracy": 0.8626342117786407,
"num_tokens": 19241798.0,
"step": 414
},
{
"epoch": 5.254777070063694,
"grad_norm": 0.5729110240936279,
"learning_rate": 2.918441679706949e-05,
"loss": 0.5593,
"mean_token_accuracy": 0.8617399036884308,
"num_tokens": 19287116.0,
"step": 415
},
{
"epoch": 5.267515923566879,
"grad_norm": 0.6001513600349426,
"learning_rate": 2.8766359746623894e-05,
"loss": 0.5541,
"mean_token_accuracy": 0.8645914494991302,
"num_tokens": 19333494.0,
"step": 416
},
{
"epoch": 5.280254777070064,
"grad_norm": 0.620059609413147,
"learning_rate": 2.835081500060498e-05,
"loss": 0.5485,
"mean_token_accuracy": 0.8663501143455505,
"num_tokens": 19380078.0,
"step": 417
},
{
"epoch": 5.292993630573249,
"grad_norm": 0.6021698117256165,
"learning_rate": 2.7937797214657147e-05,
"loss": 0.5778,
"mean_token_accuracy": 0.8575234711170197,
"num_tokens": 19429142.0,
"step": 418
},
{
"epoch": 5.305732484076433,
"grad_norm": 0.6448414325714111,
"learning_rate": 2.7527320955302794e-05,
"loss": 0.5887,
"mean_token_accuracy": 0.8552671074867249,
"num_tokens": 19477251.0,
"step": 419
},
{
"epoch": 5.318471337579618,
"grad_norm": 0.6018058657646179,
"learning_rate": 2.7119400699428332e-05,
"loss": 0.5486,
"mean_token_accuracy": 0.8661691546440125,
"num_tokens": 19523462.0,
"step": 420
},
{
"epoch": 5.3312101910828025,
"grad_norm": 0.598821222782135,
"learning_rate": 2.671405083377386e-05,
"loss": 0.5559,
"mean_token_accuracy": 0.8639799356460571,
"num_tokens": 19570087.0,
"step": 421
},
{
"epoch": 5.343949044585988,
"grad_norm": 0.6228508949279785,
"learning_rate": 2.6311285654425575e-05,
"loss": 0.5626,
"mean_token_accuracy": 0.8616799116134644,
"num_tokens": 19618251.0,
"step": 422
},
{
"epoch": 5.356687898089172,
"grad_norm": 0.591503381729126,
"learning_rate": 2.5911119366311597e-05,
"loss": 0.5654,
"mean_token_accuracy": 0.8612537682056427,
"num_tokens": 19666992.0,
"step": 423
},
{
"epoch": 5.369426751592357,
"grad_norm": 0.5860921144485474,
"learning_rate": 2.5513566082701135e-05,
"loss": 0.5671,
"mean_token_accuracy": 0.8606434762477875,
"num_tokens": 19714972.0,
"step": 424
},
{
"epoch": 5.382165605095541,
"grad_norm": 0.5802496671676636,
"learning_rate": 2.51186398247065e-05,
"loss": 0.5646,
"mean_token_accuracy": 0.8609052002429962,
"num_tokens": 19762246.0,
"step": 425
},
{
"epoch": 5.3949044585987265,
"grad_norm": 0.5896458625793457,
"learning_rate": 2.472635452078883e-05,
"loss": 0.5398,
"mean_token_accuracy": 0.8695516288280487,
"num_tokens": 19805820.0,
"step": 426
},
{
"epoch": 5.407643312101911,
"grad_norm": 0.6189890503883362,
"learning_rate": 2.433672400626663e-05,
"loss": 0.56,
"mean_token_accuracy": 0.8619295656681061,
"num_tokens": 19850138.0,
"step": 427
},
{
"epoch": 5.420382165605096,
"grad_norm": 0.5819289088249207,
"learning_rate": 2.3949762022828092e-05,
"loss": 0.5778,
"mean_token_accuracy": 0.8582758605480194,
"num_tokens": 19897704.0,
"step": 428
},
{
"epoch": 5.43312101910828,
"grad_norm": 0.5880019664764404,
"learning_rate": 2.3565482218046075e-05,
"loss": 0.5617,
"mean_token_accuracy": 0.8624799251556396,
"num_tokens": 19945551.0,
"step": 429
},
{
"epoch": 5.445859872611465,
"grad_norm": 0.5863910913467407,
"learning_rate": 2.3183898144897177e-05,
"loss": 0.5669,
"mean_token_accuracy": 0.8587363660335541,
"num_tokens": 19992591.0,
"step": 430
},
{
"epoch": 5.45859872611465,
"grad_norm": 0.5961703062057495,
"learning_rate": 2.2805023261283497e-05,
"loss": 0.5723,
"mean_token_accuracy": 0.8603742122650146,
"num_tokens": 20040108.0,
"step": 431
},
{
"epoch": 5.471337579617835,
"grad_norm": 0.5917873382568359,
"learning_rate": 2.242887092955801e-05,
"loss": 0.5632,
"mean_token_accuracy": 0.8612915873527527,
"num_tokens": 20084175.0,
"step": 432
},
{
"epoch": 5.484076433121019,
"grad_norm": 0.5897845029830933,
"learning_rate": 2.2055454416053422e-05,
"loss": 0.5538,
"mean_token_accuracy": 0.8653071224689484,
"num_tokens": 20128240.0,
"step": 433
},
{
"epoch": 5.496815286624204,
"grad_norm": 0.6288106441497803,
"learning_rate": 2.168478689061413e-05,
"loss": 0.5509,
"mean_token_accuracy": 0.8656776249408722,
"num_tokens": 20174729.0,
"step": 434
},
{
"epoch": 5.509554140127388,
"grad_norm": 0.5910764932632446,
"learning_rate": 2.131688142613183e-05,
"loss": 0.5725,
"mean_token_accuracy": 0.8601183593273163,
"num_tokens": 20224313.0,
"step": 435
},
{
"epoch": 5.522292993630574,
"grad_norm": 0.5756183862686157,
"learning_rate": 2.095175099808444e-05,
"loss": 0.5465,
"mean_token_accuracy": 0.8652230203151703,
"num_tokens": 20271807.0,
"step": 436
},
{
"epoch": 5.535031847133758,
"grad_norm": 0.6019288301467896,
"learning_rate": 2.058940848407854e-05,
"loss": 0.5743,
"mean_token_accuracy": 0.8625396490097046,
"num_tokens": 20319175.0,
"step": 437
},
{
"epoch": 5.547770700636943,
"grad_norm": 0.593775749206543,
"learning_rate": 2.0229866663395026e-05,
"loss": 0.547,
"mean_token_accuracy": 0.8664292097091675,
"num_tokens": 20363325.0,
"step": 438
},
{
"epoch": 5.560509554140127,
"grad_norm": 0.602142870426178,
"learning_rate": 1.987313821653861e-05,
"loss": 0.5731,
"mean_token_accuracy": 0.8586575984954834,
"num_tokens": 20411205.0,
"step": 439
},
{
"epoch": 5.573248407643312,
"grad_norm": 0.591356098651886,
"learning_rate": 1.951923572479044e-05,
"loss": 0.5506,
"mean_token_accuracy": 0.8643897771835327,
"num_tokens": 20454798.0,
"step": 440
},
{
"epoch": 5.585987261146497,
"grad_norm": 0.6110073924064636,
"learning_rate": 1.9168171669764413e-05,
"loss": 0.5401,
"mean_token_accuracy": 0.8683696687221527,
"num_tokens": 20500406.0,
"step": 441
},
{
"epoch": 5.598726114649682,
"grad_norm": 0.5945736765861511,
"learning_rate": 1.881995843296708e-05,
"loss": 0.5523,
"mean_token_accuracy": 0.8627299666404724,
"num_tokens": 20545603.0,
"step": 442
},
{
"epoch": 5.611464968152866,
"grad_norm": 0.6136711239814758,
"learning_rate": 1.847460829536075e-05,
"loss": 0.5806,
"mean_token_accuracy": 0.8575672209262848,
"num_tokens": 20590976.0,
"step": 443
},
{
"epoch": 5.624203821656051,
"grad_norm": 0.5992861390113831,
"learning_rate": 1.8132133436930642e-05,
"loss": 0.5705,
"mean_token_accuracy": 0.8608649969100952,
"num_tokens": 20639201.0,
"step": 444
},
{
"epoch": 5.6369426751592355,
"grad_norm": 0.5806087255477905,
"learning_rate": 1.7792545936255013e-05,
"loss": 0.5845,
"mean_token_accuracy": 0.8575698733329773,
"num_tokens": 20691761.0,
"step": 445
},
{
"epoch": 5.649681528662421,
"grad_norm": 0.5738813877105713,
"learning_rate": 1.745585777007943e-05,
"loss": 0.5557,
"mean_token_accuracy": 0.8638261556625366,
"num_tokens": 20736217.0,
"step": 446
},
{
"epoch": 5.662420382165605,
"grad_norm": 0.6299033761024475,
"learning_rate": 1.7122080812894147e-05,
"loss": 0.5859,
"mean_token_accuracy": 0.8571733236312866,
"num_tokens": 20783324.0,
"step": 447
},
{
"epoch": 5.67515923566879,
"grad_norm": 0.5905052423477173,
"learning_rate": 1.679122683651546e-05,
"loss": 0.5646,
"mean_token_accuracy": 0.8605034649372101,
"num_tokens": 20829442.0,
"step": 448
},
{
"epoch": 5.687898089171974,
"grad_norm": 0.6001847982406616,
"learning_rate": 1.6463307509670524e-05,
"loss": 0.5715,
"mean_token_accuracy": 0.8600328266620636,
"num_tokens": 20876617.0,
"step": 449
},
{
"epoch": 5.7006369426751595,
"grad_norm": 0.615409791469574,
"learning_rate": 1.6138334397585675e-05,
"loss": 0.5581,
"mean_token_accuracy": 0.8639148473739624,
"num_tokens": 20923904.0,
"step": 450
},
{
"epoch": 5.713375796178344,
"grad_norm": 0.6029254794120789,
"learning_rate": 1.5816318961578757e-05,
"loss": 0.5588,
"mean_token_accuracy": 0.8626428246498108,
"num_tokens": 20968829.0,
"step": 451
},
{
"epoch": 5.726114649681529,
"grad_norm": 0.6081089973449707,
"learning_rate": 1.5497272558654697e-05,
"loss": 0.5754,
"mean_token_accuracy": 0.8593170344829559,
"num_tokens": 21013343.0,
"step": 452
},
{
"epoch": 5.738853503184713,
"grad_norm": 0.6028342843055725,
"learning_rate": 1.5181206441105078e-05,
"loss": 0.5784,
"mean_token_accuracy": 0.8598412871360779,
"num_tokens": 21063652.0,
"step": 453
},
{
"epoch": 5.751592356687898,
"grad_norm": 0.5935065746307373,
"learning_rate": 1.4868131756111225e-05,
"loss": 0.5785,
"mean_token_accuracy": 0.858275294303894,
"num_tokens": 21110656.0,
"step": 454
},
{
"epoch": 5.764331210191083,
"grad_norm": 0.5879067182540894,
"learning_rate": 1.4558059545351143e-05,
"loss": 0.5793,
"mean_token_accuracy": 0.855660617351532,
"num_tokens": 21159702.0,
"step": 455
},
{
"epoch": 5.777070063694268,
"grad_norm": 0.6150187849998474,
"learning_rate": 1.4251000744610033e-05,
"loss": 0.5673,
"mean_token_accuracy": 0.8586822152137756,
"num_tokens": 21204767.0,
"step": 456
},
{
"epoch": 5.789808917197452,
"grad_norm": 0.5964578986167908,
"learning_rate": 1.394696618339456e-05,
"loss": 0.5565,
"mean_token_accuracy": 0.8625064194202423,
"num_tokens": 21253400.0,
"step": 457
},
{
"epoch": 5.802547770700637,
"grad_norm": 0.5985179543495178,
"learning_rate": 1.364596658455105e-05,
"loss": 0.5715,
"mean_token_accuracy": 0.859099268913269,
"num_tokens": 21302541.0,
"step": 458
},
{
"epoch": 5.8152866242038215,
"grad_norm": 0.6097904443740845,
"learning_rate": 1.3348012563887102e-05,
"loss": 0.527,
"mean_token_accuracy": 0.8690455555915833,
"num_tokens": 21348200.0,
"step": 459
},
{
"epoch": 5.828025477707007,
"grad_norm": 0.6043243408203125,
"learning_rate": 1.3053114629797437e-05,
"loss": 0.5621,
"mean_token_accuracy": 0.8595924079418182,
"num_tokens": 21393364.0,
"step": 460
},
{
"epoch": 5.840764331210191,
"grad_norm": 0.6127822399139404,
"learning_rate": 1.2761283182893047e-05,
"loss": 0.5672,
"mean_token_accuracy": 0.8621090352535248,
"num_tokens": 21438173.0,
"step": 461
},
{
"epoch": 5.853503184713376,
"grad_norm": 0.5967704653739929,
"learning_rate": 1.2472528515634584e-05,
"loss": 0.5442,
"mean_token_accuracy": 0.8661996722221375,
"num_tokens": 21484340.0,
"step": 462
},
{
"epoch": 5.86624203821656,
"grad_norm": 0.5981035232543945,
"learning_rate": 1.218686081196917e-05,
"loss": 0.5573,
"mean_token_accuracy": 0.8626265227794647,
"num_tokens": 21531558.0,
"step": 463
},
{
"epoch": 5.8789808917197455,
"grad_norm": 0.5868001580238342,
"learning_rate": 1.1904290146971397e-05,
"loss": 0.5759,
"mean_token_accuracy": 0.8578618168830872,
"num_tokens": 21581138.0,
"step": 464
},
{
"epoch": 5.89171974522293,
"grad_norm": 0.5864095687866211,
"learning_rate": 1.1624826486487871e-05,
"loss": 0.5718,
"mean_token_accuracy": 0.8594149053096771,
"num_tokens": 21632418.0,
"step": 465
},
{
"epoch": 5.904458598726115,
"grad_norm": 0.602932870388031,
"learning_rate": 1.1348479686785751e-05,
"loss": 0.5519,
"mean_token_accuracy": 0.8616421222686768,
"num_tokens": 21677037.0,
"step": 466
},
{
"epoch": 5.917197452229299,
"grad_norm": 0.6247318983078003,
"learning_rate": 1.1075259494205225e-05,
"loss": 0.5868,
"mean_token_accuracy": 0.8568370342254639,
"num_tokens": 21723655.0,
"step": 467
},
{
"epoch": 5.929936305732484,
"grad_norm": 0.6046456098556519,
"learning_rate": 1.0805175544815648e-05,
"loss": 0.5888,
"mean_token_accuracy": 0.8549422025680542,
"num_tokens": 21771636.0,
"step": 468
},
{
"epoch": 5.942675159235669,
"grad_norm": 0.599376916885376,
"learning_rate": 1.0538237364075787e-05,
"loss": 0.5746,
"mean_token_accuracy": 0.8595117330551147,
"num_tokens": 21818294.0,
"step": 469
},
{
"epoch": 5.955414012738854,
"grad_norm": 0.5762757658958435,
"learning_rate": 1.0274454366497787e-05,
"loss": 0.5758,
"mean_token_accuracy": 0.8589733839035034,
"num_tokens": 21865302.0,
"step": 470
},
{
"epoch": 5.968152866242038,
"grad_norm": 0.6216184496879578,
"learning_rate": 1.0013835855315235e-05,
"loss": 0.5862,
"mean_token_accuracy": 0.857296347618103,
"num_tokens": 21912717.0,
"step": 471
},
{
"epoch": 5.980891719745223,
"grad_norm": 0.6174598932266235,
"learning_rate": 9.756391022154954e-06,
"loss": 0.5497,
"mean_token_accuracy": 0.8617016673088074,
"num_tokens": 21956909.0,
"step": 472
},
{
"epoch": 5.993630573248407,
"grad_norm": 0.5991003513336182,
"learning_rate": 9.502128946712862e-06,
"loss": 0.5824,
"mean_token_accuracy": 0.8596709668636322,
"num_tokens": 22004284.0,
"step": 473
},
{
"epoch": 6.0,
"grad_norm": 0.874085545539856,
"learning_rate": 9.251058596433793e-06,
"loss": 0.4975,
"mean_token_accuracy": 0.880401074886322,
"num_tokens": 22026256.0,
"step": 474
},
{
"epoch": 6.012738853503185,
"grad_norm": 0.5285953283309937,
"learning_rate": 9.003188826195142e-06,
"loss": 0.5064,
"mean_token_accuracy": 0.8789235949516296,
"num_tokens": 22073817.0,
"step": 475
},
{
"epoch": 6.025477707006369,
"grad_norm": 0.5319235324859619,
"learning_rate": 8.758528377994667e-06,
"loss": 0.4917,
"mean_token_accuracy": 0.883221447467804,
"num_tokens": 22120864.0,
"step": 476
},
{
"epoch": 6.038216560509555,
"grad_norm": 0.5413665771484375,
"learning_rate": 8.517085880642062e-06,
"loss": 0.4614,
"mean_token_accuracy": 0.8908380270004272,
"num_tokens": 22165690.0,
"step": 477
},
{
"epoch": 6.050955414012739,
"grad_norm": 0.5396758913993835,
"learning_rate": 8.278869849454718e-06,
"loss": 0.4728,
"mean_token_accuracy": 0.8866445422172546,
"num_tokens": 22211467.0,
"step": 478
},
{
"epoch": 6.063694267515924,
"grad_norm": 0.5413012504577637,
"learning_rate": 8.043888685957313e-06,
"loss": 0.4671,
"mean_token_accuracy": 0.8871977031230927,
"num_tokens": 22256869.0,
"step": 479
},
{
"epoch": 6.076433121019108,
"grad_norm": 0.5447385907173157,
"learning_rate": 7.812150677585673e-06,
"loss": 0.4709,
"mean_token_accuracy": 0.8885963261127472,
"num_tokens": 22304712.0,
"step": 480
},
{
"epoch": 6.089171974522293,
"grad_norm": 0.5395948886871338,
"learning_rate": 7.583663997394241e-06,
"loss": 0.4656,
"mean_token_accuracy": 0.8892465233802795,
"num_tokens": 22353292.0,
"step": 481
},
{
"epoch": 6.101910828025478,
"grad_norm": 0.5652547478675842,
"learning_rate": 7.358436703768035e-06,
"loss": 0.4539,
"mean_token_accuracy": 0.8909508585929871,
"num_tokens": 22401089.0,
"step": 482
},
{
"epoch": 6.114649681528663,
"grad_norm": 0.5841154456138611,
"learning_rate": 7.136476740138387e-06,
"loss": 0.4564,
"mean_token_accuracy": 0.8898600935935974,
"num_tokens": 22447040.0,
"step": 483
},
{
"epoch": 6.127388535031847,
"grad_norm": 0.5878347754478455,
"learning_rate": 6.917791934702655e-06,
"loss": 0.4596,
"mean_token_accuracy": 0.8882217407226562,
"num_tokens": 22494482.0,
"step": 484
},
{
"epoch": 6.140127388535032,
"grad_norm": 0.5902244448661804,
"learning_rate": 6.702390000148351e-06,
"loss": 0.4571,
"mean_token_accuracy": 0.8898824751377106,
"num_tokens": 22539295.0,
"step": 485
},
{
"epoch": 6.1528662420382165,
"grad_norm": 0.6030483245849609,
"learning_rate": 6.490278533380956e-06,
"loss": 0.4868,
"mean_token_accuracy": 0.8809216916561127,
"num_tokens": 22588300.0,
"step": 486
},
{
"epoch": 6.165605095541402,
"grad_norm": 0.5984454154968262,
"learning_rate": 6.281465015256094e-06,
"loss": 0.4656,
"mean_token_accuracy": 0.8885324001312256,
"num_tokens": 22636028.0,
"step": 487
},
{
"epoch": 6.178343949044586,
"grad_norm": 0.6295449137687683,
"learning_rate": 6.0759568103156195e-06,
"loss": 0.4845,
"mean_token_accuracy": 0.8819713294506073,
"num_tokens": 22684018.0,
"step": 488
},
{
"epoch": 6.191082802547771,
"grad_norm": 0.6019818186759949,
"learning_rate": 5.873761166527936e-06,
"loss": 0.4505,
"mean_token_accuracy": 0.8912405371665955,
"num_tokens": 22730357.0,
"step": 489
},
{
"epoch": 6.203821656050955,
"grad_norm": 0.6028389930725098,
"learning_rate": 5.674885215032322e-06,
"loss": 0.461,
"mean_token_accuracy": 0.8886306285858154,
"num_tokens": 22778899.0,
"step": 490
},
{
"epoch": 6.2165605095541405,
"grad_norm": 0.6356772184371948,
"learning_rate": 5.479335969887467e-06,
"loss": 0.4548,
"mean_token_accuracy": 0.8894259035587311,
"num_tokens": 22824833.0,
"step": 491
},
{
"epoch": 6.229299363057325,
"grad_norm": 0.6403616070747375,
"learning_rate": 5.287120327824091e-06,
"loss": 0.474,
"mean_token_accuracy": 0.8855110108852386,
"num_tokens": 22871101.0,
"step": 492
},
{
"epoch": 6.24203821656051,
"grad_norm": 0.5932328701019287,
"learning_rate": 5.098245068001661e-06,
"loss": 0.4678,
"mean_token_accuracy": 0.8874426782131195,
"num_tokens": 22920768.0,
"step": 493
},
{
"epoch": 6.254777070063694,
"grad_norm": 0.612916111946106,
"learning_rate": 4.9127168517693946e-06,
"loss": 0.4428,
"mean_token_accuracy": 0.8922592103481293,
"num_tokens": 22964967.0,
"step": 494
},
{
"epoch": 6.267515923566879,
"grad_norm": 0.6020427346229553,
"learning_rate": 4.730542222431223e-06,
"loss": 0.4383,
"mean_token_accuracy": 0.8952569663524628,
"num_tokens": 23009889.0,
"step": 495
},
{
"epoch": 6.280254777070064,
"grad_norm": 0.596607506275177,
"learning_rate": 4.551727605015032e-06,
"loss": 0.4449,
"mean_token_accuracy": 0.8933581709861755,
"num_tokens": 23056164.0,
"step": 496
},
{
"epoch": 6.292993630573249,
"grad_norm": 0.61225825548172,
"learning_rate": 4.376279306046183e-06,
"loss": 0.4782,
"mean_token_accuracy": 0.8831726312637329,
"num_tokens": 23101966.0,
"step": 497
},
{
"epoch": 6.305732484076433,
"grad_norm": 0.6055213809013367,
"learning_rate": 4.2042035133248895e-06,
"loss": 0.465,
"mean_token_accuracy": 0.88702791929245,
"num_tokens": 23150516.0,
"step": 498
},
{
"epoch": 6.318471337579618,
"grad_norm": 0.5911315083503723,
"learning_rate": 4.035506295708191e-06,
"loss": 0.4496,
"mean_token_accuracy": 0.8899335861206055,
"num_tokens": 23197593.0,
"step": 499
},
{
"epoch": 6.3312101910828025,
"grad_norm": 0.6018553972244263,
"learning_rate": 3.870193602895733e-06,
"loss": 0.4539,
"mean_token_accuracy": 0.8879165351390839,
"num_tokens": 23242618.0,
"step": 500
},
{
"epoch": 6.343949044585988,
"grad_norm": 0.5925772190093994,
"learning_rate": 3.7082712652200867e-06,
"loss": 0.4408,
"mean_token_accuracy": 0.8935061991214752,
"num_tokens": 23286589.0,
"step": 501
},
{
"epoch": 6.356687898089172,
"grad_norm": 0.5770175457000732,
"learning_rate": 3.54974499344094e-06,
"loss": 0.4548,
"mean_token_accuracy": 0.8910494446754456,
"num_tokens": 23333149.0,
"step": 502
},
{
"epoch": 6.369426751592357,
"grad_norm": 0.5860756039619446,
"learning_rate": 3.3946203785439113e-06,
"loss": 0.4697,
"mean_token_accuracy": 0.8873529136180878,
"num_tokens": 23380362.0,
"step": 503
},
{
"epoch": 6.382165605095541,
"grad_norm": 0.5788154006004333,
"learning_rate": 3.2429028915431534e-06,
"loss": 0.4474,
"mean_token_accuracy": 0.8910690546035767,
"num_tokens": 23427020.0,
"step": 504
},
{
"epoch": 6.3949044585987265,
"grad_norm": 0.575828492641449,
"learning_rate": 3.094597883288575e-06,
"loss": 0.4873,
"mean_token_accuracy": 0.8848420679569244,
"num_tokens": 23476005.0,
"step": 505
},
{
"epoch": 6.407643312101911,
"grad_norm": 0.5773833394050598,
"learning_rate": 2.9497105842769435e-06,
"loss": 0.4369,
"mean_token_accuracy": 0.8952364027500153,
"num_tokens": 23522481.0,
"step": 506
},
{
"epoch": 6.420382165605096,
"grad_norm": 0.591640055179596,
"learning_rate": 2.808246104467582e-06,
"loss": 0.4667,
"mean_token_accuracy": 0.8868449926376343,
"num_tokens": 23568307.0,
"step": 507
},
{
"epoch": 6.43312101910828,
"grad_norm": 0.586330771446228,
"learning_rate": 2.6702094331020887e-06,
"loss": 0.4723,
"mean_token_accuracy": 0.8849689066410065,
"num_tokens": 23616018.0,
"step": 508
},
{
"epoch": 6.445859872611465,
"grad_norm": 0.5872050523757935,
"learning_rate": 2.5356054385282766e-06,
"loss": 0.4767,
"mean_token_accuracy": 0.8855108022689819,
"num_tokens": 23662705.0,
"step": 509
},
{
"epoch": 6.45859872611465,
"grad_norm": 0.5915942192077637,
"learning_rate": 2.404438868028658e-06,
"loss": 0.443,
"mean_token_accuracy": 0.8939434885978699,
"num_tokens": 23708614.0,
"step": 510
},
{
"epoch": 6.471337579617835,
"grad_norm": 0.5772258639335632,
"learning_rate": 2.276714347652831e-06,
"loss": 0.4535,
"mean_token_accuracy": 0.8918261229991913,
"num_tokens": 23755220.0,
"step": 511
},
{
"epoch": 6.484076433121019,
"grad_norm": 0.602470874786377,
"learning_rate": 2.152436382054479e-06,
"loss": 0.4976,
"mean_token_accuracy": 0.8814437389373779,
"num_tokens": 23801965.0,
"step": 512
},
{
"epoch": 6.496815286624204,
"grad_norm": 0.5672124624252319,
"learning_rate": 2.0316093543323757e-06,
"loss": 0.4792,
"mean_token_accuracy": 0.8845764100551605,
"num_tokens": 23850903.0,
"step": 513
},
{
"epoch": 6.509554140127388,
"grad_norm": 0.570857584476471,
"learning_rate": 1.914237525875917e-06,
"loss": 0.4576,
"mean_token_accuracy": 0.8894221186637878,
"num_tokens": 23898377.0,
"step": 514
},
{
"epoch": 6.522292993630574,
"grad_norm": 0.5888267755508423,
"learning_rate": 1.8003250362147005e-06,
"loss": 0.462,
"mean_token_accuracy": 0.8884663283824921,
"num_tokens": 23945604.0,
"step": 515
},
{
"epoch": 6.535031847133758,
"grad_norm": 0.593219518661499,
"learning_rate": 1.6898759028726285e-06,
"loss": 0.5017,
"mean_token_accuracy": 0.8780794739723206,
"num_tokens": 23993458.0,
"step": 516
},
{
"epoch": 6.547770700636943,
"grad_norm": 0.5750519037246704,
"learning_rate": 1.5828940212261889e-06,
"loss": 0.472,
"mean_token_accuracy": 0.8875796794891357,
"num_tokens": 24040106.0,
"step": 517
},
{
"epoch": 6.560509554140127,
"grad_norm": 0.5601825714111328,
"learning_rate": 1.479383164367043e-06,
"loss": 0.4602,
"mean_token_accuracy": 0.8908886611461639,
"num_tokens": 24087994.0,
"step": 518
},
{
"epoch": 6.573248407643312,
"grad_norm": 0.5909698009490967,
"learning_rate": 1.3793469829689987e-06,
"loss": 0.4625,
"mean_token_accuracy": 0.8879349529743195,
"num_tokens": 24134642.0,
"step": 519
},
{
"epoch": 6.585987261146497,
"grad_norm": 0.5777092576026917,
"learning_rate": 1.2827890051592128e-06,
"loss": 0.46,
"mean_token_accuracy": 0.8871607184410095,
"num_tokens": 24182448.0,
"step": 520
},
{
"epoch": 6.598726114649682,
"grad_norm": 0.6093650460243225,
"learning_rate": 1.1897126363937804e-06,
"loss": 0.4713,
"mean_token_accuracy": 0.8866488337516785,
"num_tokens": 24226243.0,
"step": 521
},
{
"epoch": 6.611464968152866,
"grad_norm": 0.5591498613357544,
"learning_rate": 1.1001211593376526e-06,
"loss": 0.4614,
"mean_token_accuracy": 0.8907770216464996,
"num_tokens": 24275531.0,
"step": 522
},
{
"epoch": 6.624203821656051,
"grad_norm": 0.5817198753356934,
"learning_rate": 1.0140177337488288e-06,
"loss": 0.4749,
"mean_token_accuracy": 0.8850551843643188,
"num_tokens": 24323213.0,
"step": 523
},
{
"epoch": 6.6369426751592355,
"grad_norm": 0.5963823199272156,
"learning_rate": 9.314053963669245e-07,
"loss": 0.4544,
"mean_token_accuracy": 0.8898647129535675,
"num_tokens": 24369413.0,
"step": 524
},
{
"epoch": 6.649681528662421,
"grad_norm": 0.6051519513130188,
"learning_rate": 8.522870608060563e-07,
"loss": 0.4643,
"mean_token_accuracy": 0.8886588215827942,
"num_tokens": 24413967.0,
"step": 525
},
{
"epoch": 6.662420382165605,
"grad_norm": 0.5751470923423767,
"learning_rate": 7.766655174521465e-07,
"loss": 0.4711,
"mean_token_accuracy": 0.8882945775985718,
"num_tokens": 24462445.0,
"step": 526
},
{
"epoch": 6.67515923566879,
"grad_norm": 0.5853144526481628,
"learning_rate": 7.045434333643797e-07,
"loss": 0.4558,
"mean_token_accuracy": 0.8899858295917511,
"num_tokens": 24509589.0,
"step": 527
},
{
"epoch": 6.687898089171974,
"grad_norm": 0.5752429366111755,
"learning_rate": 6.359233521813224e-07,
"loss": 0.4638,
"mean_token_accuracy": 0.8884373903274536,
"num_tokens": 24556095.0,
"step": 528
},
{
"epoch": 6.7006369426751595,
"grad_norm": 0.5856727957725525,
"learning_rate": 5.70807694031028e-07,
"loss": 0.4818,
"mean_token_accuracy": 0.8827240765094757,
"num_tokens": 24604994.0,
"step": 529
},
{
"epoch": 6.713375796178344,
"grad_norm": 0.588467001914978,
"learning_rate": 5.091987554458388e-07,
"loss": 0.4655,
"mean_token_accuracy": 0.8869950175285339,
"num_tokens": 24651020.0,
"step": 530
},
{
"epoch": 6.726114649681529,
"grad_norm": 0.5824346542358398,
"learning_rate": 4.510987092812502e-07,
"loss": 0.4726,
"mean_token_accuracy": 0.8863205313682556,
"num_tokens": 24697824.0,
"step": 531
},
{
"epoch": 6.738853503184713,
"grad_norm": 0.5869485139846802,
"learning_rate": 3.965096046394057e-07,
"loss": 0.4656,
"mean_token_accuracy": 0.8880146145820618,
"num_tokens": 24745058.0,
"step": 532
},
{
"epoch": 6.751592356687898,
"grad_norm": 0.5894216299057007,
"learning_rate": 3.4543336679673245e-07,
"loss": 0.473,
"mean_token_accuracy": 0.8840719163417816,
"num_tokens": 24792886.0,
"step": 533
},
{
"epoch": 6.764331210191083,
"grad_norm": 0.5966050624847412,
"learning_rate": 2.978717971360956e-07,
"loss": 0.467,
"mean_token_accuracy": 0.8892892599105835,
"num_tokens": 24839223.0,
"step": 534
},
{
"epoch": 6.777070063694268,
"grad_norm": 0.5877535343170166,
"learning_rate": 2.5382657308322676e-07,
"loss": 0.4686,
"mean_token_accuracy": 0.8878327012062073,
"num_tokens": 24886155.0,
"step": 535
},
{
"epoch": 6.789808917197452,
"grad_norm": 0.5607234239578247,
"learning_rate": 2.1329924804760482e-07,
"loss": 0.462,
"mean_token_accuracy": 0.8899067938327789,
"num_tokens": 24935615.0,
"step": 536
},
{
"epoch": 6.802547770700637,
"grad_norm": 0.5836446285247803,
"learning_rate": 1.7629125136764402e-07,
"loss": 0.4877,
"mean_token_accuracy": 0.8824087679386139,
"num_tokens": 24982352.0,
"step": 537
},
{
"epoch": 6.8152866242038215,
"grad_norm": 0.5934491157531738,
"learning_rate": 1.4280388826026782e-07,
"loss": 0.4424,
"mean_token_accuracy": 0.8934253454208374,
"num_tokens": 25026903.0,
"step": 538
},
{
"epoch": 6.828025477707007,
"grad_norm": 0.5779575109481812,
"learning_rate": 1.128383397749233e-07,
"loss": 0.4827,
"mean_token_accuracy": 0.8874645829200745,
"num_tokens": 25074252.0,
"step": 539
},
{
"epoch": 6.840764331210191,
"grad_norm": 0.5870651006698608,
"learning_rate": 8.639566275189248e-08,
"loss": 0.4493,
"mean_token_accuracy": 0.8932221829891205,
"num_tokens": 25119706.0,
"step": 540
},
{
"epoch": 6.853503184713376,
"grad_norm": 0.5863420367240906,
"learning_rate": 6.347678978501082e-08,
"loss": 0.4654,
"mean_token_accuracy": 0.8872964382171631,
"num_tokens": 25165377.0,
"step": 541
},
{
"epoch": 6.86624203821656,
"grad_norm": 0.5763266086578369,
"learning_rate": 4.408252918880473e-08,
"loss": 0.4521,
"mean_token_accuracy": 0.8921694755554199,
"num_tokens": 25211636.0,
"step": 542
},
{
"epoch": 6.8789808917197455,
"grad_norm": 0.5784059166908264,
"learning_rate": 2.8213564969969963e-08,
"loss": 0.4738,
"mean_token_accuracy": 0.8872754871845245,
"num_tokens": 25258903.0,
"step": 543
},
{
"epoch": 6.89171974522293,
"grad_norm": 0.5755369067192078,
"learning_rate": 1.5870456803246392e-08,
"loss": 0.4225,
"mean_token_accuracy": 0.8984050452709198,
"num_tokens": 25302553.0,
"step": 544
},
{
"epoch": 6.904458598726115,
"grad_norm": 0.5839601159095764,
"learning_rate": 7.053640011678297e-09,
"loss": 0.445,
"mean_token_accuracy": 0.8928711414337158,
"num_tokens": 25348281.0,
"step": 545
},
{
"epoch": 6.917197452229299,
"grad_norm": 0.6116732954978943,
"learning_rate": 1.7634255512710695e-09,
"loss": 0.4755,
"mean_token_accuracy": 0.8853686451911926,
"num_tokens": 25393401.0,
"step": 546
},
{
"epoch": 6.917197452229299,
"step": 546,
"total_flos": 1.6111370622520525e+18,
"train_loss": 1.0811113911124812,
"train_runtime": 3374.9045,
"train_samples_per_second": 10.371,
"train_steps_per_second": 0.162
}
],
"logging_steps": 1.0,
"max_steps": 546,
"num_input_tokens_seen": 0,
"num_train_epochs": 7,
"save_steps": 100,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": true
},
"attributes": {}
}
},
"total_flos": 1.6111370622520525e+18,
"train_batch_size": 8,
"trial_name": null,
"trial_params": null
}