qwen7b-abap-sql-lora / checkpoint-5000 /trainer_state.json
Famali's picture
Upload folder using huggingface_hub
06dee64 verified
Raw
History Blame Contribute Delete
154 kB
{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 0.866260246234475,
"eval_steps": 0,
"global_step": 5000,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"entropy": 0.810929330997169,
"epoch": 0.00173252049246895,
"grad_norm": 0.205078125,
"learning_rate": 1.0344827586206897e-05,
"loss": 1.254616641998291,
"mean_token_accuracy": 0.7005728678777814,
"num_tokens": 55845.0,
"step": 10
},
{
"entropy": 0.8157925633713603,
"epoch": 0.0034650409849379,
"grad_norm": 0.2197265625,
"learning_rate": 2.183908045977012e-05,
"loss": 1.2245146751403808,
"mean_token_accuracy": 0.708231895044446,
"num_tokens": 113111.0,
"step": 20
},
{
"entropy": 0.8832647049799561,
"epoch": 0.00519756147740685,
"grad_norm": 0.25,
"learning_rate": 3.3333333333333335e-05,
"loss": 1.1657934188842773,
"mean_token_accuracy": 0.7022482370957732,
"num_tokens": 164227.0,
"step": 30
},
{
"entropy": 0.9586381811648608,
"epoch": 0.0069300819698758,
"grad_norm": 0.298828125,
"learning_rate": 4.482758620689655e-05,
"loss": 1.0330963134765625,
"mean_token_accuracy": 0.7396623624488712,
"num_tokens": 217441.0,
"step": 40
},
{
"entropy": 0.9550106849521398,
"epoch": 0.00866260246234475,
"grad_norm": 0.3828125,
"learning_rate": 5.632183908045977e-05,
"loss": 0.8959432601928711,
"mean_token_accuracy": 0.7642454300075769,
"num_tokens": 268289.0,
"step": 50
},
{
"entropy": 0.7945327928289772,
"epoch": 0.0103951229548137,
"grad_norm": 0.173828125,
"learning_rate": 6.781609195402298e-05,
"loss": 0.7625956058502197,
"mean_token_accuracy": 0.8002910505980253,
"num_tokens": 324346.0,
"step": 60
},
{
"entropy": 0.7771458545699715,
"epoch": 0.01212764344728265,
"grad_norm": 0.26171875,
"learning_rate": 7.931034482758621e-05,
"loss": 0.7818475723266601,
"mean_token_accuracy": 0.8028205497190356,
"num_tokens": 377817.0,
"step": 70
},
{
"entropy": 0.7179010029882192,
"epoch": 0.0138601639397516,
"grad_norm": 0.14453125,
"learning_rate": 9.080459770114943e-05,
"loss": 0.7082338809967041,
"mean_token_accuracy": 0.8104276180267334,
"num_tokens": 430404.0,
"step": 80
},
{
"entropy": 0.6860609723255038,
"epoch": 0.01559268443222055,
"grad_norm": 0.1669921875,
"learning_rate": 0.00010229885057471265,
"loss": 0.7078627109527588,
"mean_token_accuracy": 0.8185620239004493,
"num_tokens": 485403.0,
"step": 90
},
{
"entropy": 0.7082041744142771,
"epoch": 0.0173252049246895,
"grad_norm": 0.224609375,
"learning_rate": 0.00011379310344827588,
"loss": 0.6847227573394775,
"mean_token_accuracy": 0.813801309466362,
"num_tokens": 540316.0,
"step": 100
},
{
"entropy": 0.7132678747177124,
"epoch": 0.01905772541715845,
"grad_norm": 0.150390625,
"learning_rate": 0.00012528735632183908,
"loss": 0.7346933841705322,
"mean_token_accuracy": 0.8136965841054916,
"num_tokens": 596090.0,
"step": 110
},
{
"entropy": 0.6739615526981652,
"epoch": 0.0207902459096274,
"grad_norm": 0.197265625,
"learning_rate": 0.0001367816091954023,
"loss": 0.7035027980804444,
"mean_token_accuracy": 0.8202918566763401,
"num_tokens": 652251.0,
"step": 120
},
{
"entropy": 0.7046921165660024,
"epoch": 0.02252276640209635,
"grad_norm": 0.2216796875,
"learning_rate": 0.00014827586206896554,
"loss": 0.7162999153137207,
"mean_token_accuracy": 0.8211559295654297,
"num_tokens": 705549.0,
"step": 130
},
{
"entropy": 0.653735039010644,
"epoch": 0.0242552868945653,
"grad_norm": 0.2001953125,
"learning_rate": 0.00015977011494252874,
"loss": 0.6981287002563477,
"mean_token_accuracy": 0.82376406211406,
"num_tokens": 761437.0,
"step": 140
},
{
"entropy": 0.6913811397738755,
"epoch": 0.02598780738703425,
"grad_norm": 0.2138671875,
"learning_rate": 0.00017126436781609197,
"loss": 0.6812327861785888,
"mean_token_accuracy": 0.8214046888053417,
"num_tokens": 815757.0,
"step": 150
},
{
"entropy": 0.6818532709032297,
"epoch": 0.0277203278795032,
"grad_norm": 0.14453125,
"learning_rate": 0.00018275862068965518,
"loss": 0.6739168643951416,
"mean_token_accuracy": 0.8230750940740108,
"num_tokens": 870566.0,
"step": 160
},
{
"entropy": 0.6293836037628353,
"epoch": 0.02945284837197215,
"grad_norm": 0.1962890625,
"learning_rate": 0.0001942528735632184,
"loss": 0.6438039302825928,
"mean_token_accuracy": 0.8250031888484954,
"num_tokens": 919572.0,
"step": 170
},
{
"entropy": 0.7395828457549214,
"epoch": 0.0311853688644411,
"grad_norm": 0.236328125,
"learning_rate": 0.000199999606319698,
"loss": 0.7348537921905518,
"mean_token_accuracy": 0.8079655442386866,
"num_tokens": 976518.0,
"step": 180
},
{
"entropy": 0.6470751653891057,
"epoch": 0.03291788935691005,
"grad_norm": 0.1923828125,
"learning_rate": 0.0001999964568958801,
"loss": 0.6475263118743897,
"mean_token_accuracy": 0.8273555610328913,
"num_tokens": 1029982.0,
"step": 190
},
{
"entropy": 0.6638997793197632,
"epoch": 0.034650409849379,
"grad_norm": 0.1787109375,
"learning_rate": 0.00019999015814743337,
"loss": 0.6720759868621826,
"mean_token_accuracy": 0.8212123598903418,
"num_tokens": 1083520.0,
"step": 200
},
{
"entropy": 0.6658276095055043,
"epoch": 0.03638293034184795,
"grad_norm": 0.1796875,
"learning_rate": 0.00019998071027273287,
"loss": 0.6466164588928223,
"mean_token_accuracy": 0.824113554507494,
"num_tokens": 1140398.0,
"step": 210
},
{
"entropy": 0.6653693447820842,
"epoch": 0.0381154508343169,
"grad_norm": 0.1796875,
"learning_rate": 0.00019996811356933346,
"loss": 0.7165875911712647,
"mean_token_accuracy": 0.8195627685636282,
"num_tokens": 1199606.0,
"step": 220
},
{
"entropy": 0.6407551797106862,
"epoch": 0.03984797132678585,
"grad_norm": 0.1767578125,
"learning_rate": 0.00019995236843396017,
"loss": 0.6214494228363037,
"mean_token_accuracy": 0.8284068278968334,
"num_tokens": 1255643.0,
"step": 230
},
{
"entropy": 0.6598921860568225,
"epoch": 0.0415804918192548,
"grad_norm": 0.1875,
"learning_rate": 0.00019993347536249607,
"loss": 0.6686903476715088,
"mean_token_accuracy": 0.825398787111044,
"num_tokens": 1307549.0,
"step": 240
},
{
"entropy": 0.6621891765855252,
"epoch": 0.04331301231172375,
"grad_norm": 0.162109375,
"learning_rate": 0.0001999114349499664,
"loss": 0.6639114379882812,
"mean_token_accuracy": 0.8296613309532404,
"num_tokens": 1357737.0,
"step": 250
},
{
"entropy": 0.6813261322677135,
"epoch": 0.0450455328041927,
"grad_norm": 0.2275390625,
"learning_rate": 0.00019988624789051983,
"loss": 0.6541904926300048,
"mean_token_accuracy": 0.8254248831421137,
"num_tokens": 1408003.0,
"step": 260
},
{
"entropy": 0.6344376143068076,
"epoch": 0.04677805329666165,
"grad_norm": 0.1396484375,
"learning_rate": 0.00019985791497740678,
"loss": 0.6409160137176514,
"mean_token_accuracy": 0.8295672092586756,
"num_tokens": 1468512.0,
"step": 270
},
{
"entropy": 0.6638527356088162,
"epoch": 0.0485105737891306,
"grad_norm": 0.146484375,
"learning_rate": 0.00019982643710295426,
"loss": 0.6663234233856201,
"mean_token_accuracy": 0.828643910959363,
"num_tokens": 1523479.0,
"step": 280
},
{
"entropy": 0.6975623445119709,
"epoch": 0.05024309428159955,
"grad_norm": 0.197265625,
"learning_rate": 0.0001997918152585379,
"loss": 0.7597866058349609,
"mean_token_accuracy": 0.8158255266025662,
"num_tokens": 1576432.0,
"step": 290
},
{
"entropy": 0.6049194569699466,
"epoch": 0.0519756147740685,
"grad_norm": 0.203125,
"learning_rate": 0.00019975405053455051,
"loss": 0.5933527946472168,
"mean_token_accuracy": 0.8358733810484409,
"num_tokens": 1629231.0,
"step": 300
},
{
"entropy": 0.620193119905889,
"epoch": 0.05370813526653745,
"grad_norm": 0.173828125,
"learning_rate": 0.00019971314412036808,
"loss": 0.6208887100219727,
"mean_token_accuracy": 0.8321478370577097,
"num_tokens": 1679414.0,
"step": 310
},
{
"entropy": 0.6657766723074019,
"epoch": 0.0554406557590064,
"grad_norm": 0.166015625,
"learning_rate": 0.00019966909730431196,
"loss": 0.6897091865539551,
"mean_token_accuracy": 0.8228034034371376,
"num_tokens": 1737775.0,
"step": 320
},
{
"entropy": 0.644062434695661,
"epoch": 0.05717317625147535,
"grad_norm": 0.21875,
"learning_rate": 0.00019962191147360856,
"loss": 0.6630971908569336,
"mean_token_accuracy": 0.8295374032109976,
"num_tokens": 1792525.0,
"step": 330
},
{
"entropy": 0.6073618672788144,
"epoch": 0.0589056967439443,
"grad_norm": 0.234375,
"learning_rate": 0.00019957158811434553,
"loss": 0.624071455001831,
"mean_token_accuracy": 0.8320268541574478,
"num_tokens": 1842155.0,
"step": 340
},
{
"entropy": 0.6616941560059786,
"epoch": 0.06063821723641325,
"grad_norm": 0.181640625,
"learning_rate": 0.00019951812881142497,
"loss": 0.6492743015289306,
"mean_token_accuracy": 0.8291781645268201,
"num_tokens": 1899018.0,
"step": 350
},
{
"entropy": 0.6520219750702381,
"epoch": 0.0623707377288822,
"grad_norm": 0.201171875,
"learning_rate": 0.00019946153524851351,
"loss": 0.6957698822021484,
"mean_token_accuracy": 0.8234761968255043,
"num_tokens": 1951764.0,
"step": 360
},
{
"entropy": 0.6280029808636755,
"epoch": 0.06410325822135116,
"grad_norm": 0.2158203125,
"learning_rate": 0.0001994018092079893,
"loss": 0.6160636901855469,
"mean_token_accuracy": 0.8326598234474659,
"num_tokens": 2003098.0,
"step": 370
},
{
"entropy": 0.6201984202489257,
"epoch": 0.0658357787138201,
"grad_norm": 0.1298828125,
"learning_rate": 0.00019933895257088596,
"loss": 0.6358787059783936,
"mean_token_accuracy": 0.831251024082303,
"num_tokens": 2057015.0,
"step": 380
},
{
"entropy": 0.650082749966532,
"epoch": 0.06756829920628905,
"grad_norm": 0.1181640625,
"learning_rate": 0.00019927296731683315,
"loss": 0.6564774990081788,
"mean_token_accuracy": 0.8291048884391785,
"num_tokens": 2112697.0,
"step": 390
},
{
"entropy": 0.6485576028004288,
"epoch": 0.069300819698758,
"grad_norm": 0.1552734375,
"learning_rate": 0.00019920385552399432,
"loss": 0.6576817035675049,
"mean_token_accuracy": 0.8271005995571613,
"num_tokens": 2163939.0,
"step": 400
},
{
"entropy": 0.5890314053744078,
"epoch": 0.07103334019122695,
"grad_norm": 0.1328125,
"learning_rate": 0.00019913161936900133,
"loss": 0.5919264316558838,
"mean_token_accuracy": 0.8378766164183616,
"num_tokens": 2216098.0,
"step": 410
},
{
"entropy": 0.6104229719843716,
"epoch": 0.0727658606836959,
"grad_norm": 0.16796875,
"learning_rate": 0.00019905626112688582,
"loss": 0.609614372253418,
"mean_token_accuracy": 0.8336421933025122,
"num_tokens": 2267710.0,
"step": 420
},
{
"entropy": 0.6408540541771799,
"epoch": 0.07449838117616485,
"grad_norm": 0.169921875,
"learning_rate": 0.00019897778317100754,
"loss": 0.6390007495880127,
"mean_token_accuracy": 0.8281146749854088,
"num_tokens": 2316219.0,
"step": 430
},
{
"entropy": 0.6305070512928068,
"epoch": 0.0762309016686338,
"grad_norm": 0.2890625,
"learning_rate": 0.00019889618797297968,
"loss": 0.631248950958252,
"mean_token_accuracy": 0.8325294002890586,
"num_tokens": 2371925.0,
"step": 440
},
{
"entropy": 0.6037532315589488,
"epoch": 0.07796342216110275,
"grad_norm": 0.205078125,
"learning_rate": 0.00019881147810259093,
"loss": 0.6101105213165283,
"mean_token_accuracy": 0.8346767805516719,
"num_tokens": 2426625.0,
"step": 450
},
{
"entropy": 0.6217060944065451,
"epoch": 0.0796959426535717,
"grad_norm": 0.162109375,
"learning_rate": 0.00019872365622772465,
"loss": 0.6300463199615478,
"mean_token_accuracy": 0.8344658222049475,
"num_tokens": 2478515.0,
"step": 460
},
{
"entropy": 0.6248600482009351,
"epoch": 0.08142846314604064,
"grad_norm": 0.1806640625,
"learning_rate": 0.00019863272511427474,
"loss": 0.6302617073059082,
"mean_token_accuracy": 0.8273205358535052,
"num_tokens": 2532071.0,
"step": 470
},
{
"entropy": 0.6396009525284171,
"epoch": 0.0831609836385096,
"grad_norm": 0.224609375,
"learning_rate": 0.00019853868762605866,
"loss": 0.6199671268463135,
"mean_token_accuracy": 0.8307142000645399,
"num_tokens": 2589201.0,
"step": 480
},
{
"entropy": 0.6030260891653597,
"epoch": 0.08489350413097856,
"grad_norm": 0.1806640625,
"learning_rate": 0.00019844154672472706,
"loss": 0.6208174705505372,
"mean_token_accuracy": 0.8347844246774911,
"num_tokens": 2645142.0,
"step": 490
},
{
"entropy": 0.6636065155267715,
"epoch": 0.0866260246234475,
"grad_norm": 0.171875,
"learning_rate": 0.00019834130546967073,
"loss": 0.6683245182037354,
"mean_token_accuracy": 0.8294202674180269,
"num_tokens": 2699971.0,
"step": 500
},
{
"entropy": 0.6588667241856456,
"epoch": 0.08835854511591645,
"grad_norm": 0.232421875,
"learning_rate": 0.00019823796701792405,
"loss": 0.6521318435668946,
"mean_token_accuracy": 0.8271396320313216,
"num_tokens": 2755726.0,
"step": 510
},
{
"entropy": 0.6405920119024813,
"epoch": 0.0900910656083854,
"grad_norm": 0.1630859375,
"learning_rate": 0.00019813153462406566,
"loss": 0.6348390579223633,
"mean_token_accuracy": 0.8277827233076096,
"num_tokens": 2809331.0,
"step": 520
},
{
"entropy": 0.6443098559975624,
"epoch": 0.09182358610085435,
"grad_norm": 0.279296875,
"learning_rate": 0.00019802201164011586,
"loss": 0.6198469161987304,
"mean_token_accuracy": 0.8291943591088057,
"num_tokens": 2858441.0,
"step": 530
},
{
"entropy": 0.6293792264536023,
"epoch": 0.0935561065933233,
"grad_norm": 0.1533203125,
"learning_rate": 0.0001979094015154312,
"loss": 0.6151269912719727,
"mean_token_accuracy": 0.8302976503968239,
"num_tokens": 2912293.0,
"step": 540
},
{
"entropy": 0.6466425215825439,
"epoch": 0.09528862708579225,
"grad_norm": 0.1435546875,
"learning_rate": 0.00019779370779659576,
"loss": 0.6462889671325683,
"mean_token_accuracy": 0.8293194837868214,
"num_tokens": 2969052.0,
"step": 550
},
{
"entropy": 0.6073407874442637,
"epoch": 0.0970211475782612,
"grad_norm": 0.1533203125,
"learning_rate": 0.00019767493412730936,
"loss": 0.6346017360687256,
"mean_token_accuracy": 0.8343164108693599,
"num_tokens": 3025367.0,
"step": 560
},
{
"entropy": 0.5817480836063623,
"epoch": 0.09875366807073015,
"grad_norm": 0.193359375,
"learning_rate": 0.00019755308424827304,
"loss": 0.5833946228027344,
"mean_token_accuracy": 0.8394967459142209,
"num_tokens": 3074360.0,
"step": 570
},
{
"entropy": 0.6115848210640251,
"epoch": 0.1004861885631991,
"grad_norm": 0.1416015625,
"learning_rate": 0.00019742816199707096,
"loss": 0.5977429389953614,
"mean_token_accuracy": 0.8364680297672749,
"num_tokens": 3125265.0,
"step": 580
},
{
"entropy": 0.6274468263611197,
"epoch": 0.10221870905566804,
"grad_norm": 0.2255859375,
"learning_rate": 0.00019730017130804975,
"loss": 0.6550042152404785,
"mean_token_accuracy": 0.8297880813479424,
"num_tokens": 3173631.0,
"step": 590
},
{
"entropy": 0.6123087177053094,
"epoch": 0.103951229548137,
"grad_norm": 0.146484375,
"learning_rate": 0.0001971691162121945,
"loss": 0.6123240947723388,
"mean_token_accuracy": 0.8380243465304374,
"num_tokens": 3221993.0,
"step": 600
},
{
"entropy": 0.6288255278021098,
"epoch": 0.10568375004060594,
"grad_norm": 0.2041015625,
"learning_rate": 0.00019703500083700194,
"loss": 0.6531140327453613,
"mean_token_accuracy": 0.8308754049241542,
"num_tokens": 3270001.0,
"step": 610
},
{
"entropy": 0.6463912200182677,
"epoch": 0.1074162705330749,
"grad_norm": 0.23046875,
"learning_rate": 0.0001968978294063502,
"loss": 0.6550347805023193,
"mean_token_accuracy": 0.8286161825060845,
"num_tokens": 3319189.0,
"step": 620
},
{
"entropy": 0.6228113821707666,
"epoch": 0.10914879102554385,
"grad_norm": 0.15234375,
"learning_rate": 0.00019675760624036603,
"loss": 0.6403580665588379,
"mean_token_accuracy": 0.8286291882395744,
"num_tokens": 3375662.0,
"step": 630
},
{
"entropy": 0.615918574295938,
"epoch": 0.1108813115180128,
"grad_norm": 0.1708984375,
"learning_rate": 0.00019661433575528857,
"loss": 0.612631368637085,
"mean_token_accuracy": 0.8331956438720226,
"num_tokens": 3424137.0,
"step": 640
},
{
"entropy": 0.6141920768655836,
"epoch": 0.11261383201048175,
"grad_norm": 0.1494140625,
"learning_rate": 0.0001964680224633304,
"loss": 0.6380485534667969,
"mean_token_accuracy": 0.8324795596301555,
"num_tokens": 3475797.0,
"step": 650
},
{
"entropy": 0.6042345489375294,
"epoch": 0.1143463525029507,
"grad_norm": 0.1533203125,
"learning_rate": 0.00019631867097253528,
"loss": 0.6176069736480713,
"mean_token_accuracy": 0.8363753166049719,
"num_tokens": 3529500.0,
"step": 660
},
{
"entropy": 0.6391982820816338,
"epoch": 0.11607887299541965,
"grad_norm": 0.197265625,
"learning_rate": 0.00019616628598663322,
"loss": 0.6678025245666503,
"mean_token_accuracy": 0.8258381471037864,
"num_tokens": 3581994.0,
"step": 670
},
{
"entropy": 0.6329770868644118,
"epoch": 0.1178113934878886,
"grad_norm": 0.205078125,
"learning_rate": 0.0001960108723048921,
"loss": 0.6337652206420898,
"mean_token_accuracy": 0.8345998499542475,
"num_tokens": 3638782.0,
"step": 680
},
{
"entropy": 0.6326605278067291,
"epoch": 0.11954391398035755,
"grad_norm": 0.14453125,
"learning_rate": 0.0001958524348219667,
"loss": 0.6063634872436523,
"mean_token_accuracy": 0.832572503387928,
"num_tokens": 3691273.0,
"step": 690
},
{
"entropy": 0.5810540007427335,
"epoch": 0.1212764344728265,
"grad_norm": 0.19140625,
"learning_rate": 0.00019569097852774453,
"loss": 0.594770860671997,
"mean_token_accuracy": 0.8386940393596888,
"num_tokens": 3745624.0,
"step": 700
},
{
"entropy": 0.588012866396457,
"epoch": 0.12300895496529544,
"grad_norm": 0.166015625,
"learning_rate": 0.0001955265085071886,
"loss": 0.6192033767700196,
"mean_token_accuracy": 0.8409584548324347,
"num_tokens": 3795503.0,
"step": 710
},
{
"entropy": 0.6364398309960961,
"epoch": 0.1247414754577644,
"grad_norm": 0.1328125,
"learning_rate": 0.00019535902994017722,
"loss": 0.6561676979064941,
"mean_token_accuracy": 0.8255573306232691,
"num_tokens": 3851187.0,
"step": 720
},
{
"entropy": 0.619802868552506,
"epoch": 0.12647399595023334,
"grad_norm": 0.201171875,
"learning_rate": 0.0001951885481013411,
"loss": 0.6344377994537354,
"mean_token_accuracy": 0.8339987032115459,
"num_tokens": 3899124.0,
"step": 730
},
{
"entropy": 0.6206785554066301,
"epoch": 0.1282065164427023,
"grad_norm": 0.1455078125,
"learning_rate": 0.00019501506835989697,
"loss": 0.631008529663086,
"mean_token_accuracy": 0.8334441259503365,
"num_tokens": 3959861.0,
"step": 740
},
{
"entropy": 0.5827660778537392,
"epoch": 0.12993903693517125,
"grad_norm": 0.1630859375,
"learning_rate": 0.00019483859617947872,
"loss": 0.5870482444763183,
"mean_token_accuracy": 0.8423280280083418,
"num_tokens": 4011262.0,
"step": 750
},
{
"entropy": 0.5850820791441947,
"epoch": 0.1316715574276402,
"grad_norm": 0.158203125,
"learning_rate": 0.000194659137117965,
"loss": 0.5706618785858154,
"mean_token_accuracy": 0.835949943959713,
"num_tokens": 4066973.0,
"step": 760
},
{
"entropy": 0.5861118984874338,
"epoch": 0.13340407792010914,
"grad_norm": 0.14453125,
"learning_rate": 0.00019447669682730458,
"loss": 0.5910950183868409,
"mean_token_accuracy": 0.8391546167433261,
"num_tokens": 4122334.0,
"step": 770
},
{
"entropy": 0.6104440504685045,
"epoch": 0.1351365984125781,
"grad_norm": 0.1552734375,
"learning_rate": 0.00019429128105333802,
"loss": 0.6063616752624512,
"mean_token_accuracy": 0.8353819210082293,
"num_tokens": 4169982.0,
"step": 780
},
{
"entropy": 0.5728639733977616,
"epoch": 0.13686911890504705,
"grad_norm": 0.15625,
"learning_rate": 0.00019410289563561684,
"loss": 0.5704578399658203,
"mean_token_accuracy": 0.8447943590581417,
"num_tokens": 4224171.0,
"step": 790
},
{
"entropy": 0.629005889594555,
"epoch": 0.138601639397516,
"grad_norm": 0.1884765625,
"learning_rate": 0.0001939115465072196,
"loss": 0.6602046966552735,
"mean_token_accuracy": 0.8233518835157156,
"num_tokens": 4277323.0,
"step": 800
},
{
"entropy": 0.656224881671369,
"epoch": 0.14033415988998496,
"grad_norm": 0.1884765625,
"learning_rate": 0.0001937172396945651,
"loss": 0.6153887271881103,
"mean_token_accuracy": 0.8298857126384973,
"num_tokens": 4335646.0,
"step": 810
},
{
"entropy": 0.5757689834572375,
"epoch": 0.1420666803824539,
"grad_norm": 0.1923828125,
"learning_rate": 0.00019351998131722243,
"loss": 0.5900076866149903,
"mean_token_accuracy": 0.8418699573725462,
"num_tokens": 4388682.0,
"step": 820
},
{
"entropy": 0.6217615368776024,
"epoch": 0.14379920087492284,
"grad_norm": 0.2197265625,
"learning_rate": 0.0001933197775877184,
"loss": 0.6482601642608643,
"mean_token_accuracy": 0.8346694391220808,
"num_tokens": 4442000.0,
"step": 830
},
{
"entropy": 0.6114513349719346,
"epoch": 0.1455317213673918,
"grad_norm": 0.2060546875,
"learning_rate": 0.00019311663481134174,
"loss": 0.582618522644043,
"mean_token_accuracy": 0.8370612319558859,
"num_tokens": 4498203.0,
"step": 840
},
{
"entropy": 0.6372988875955343,
"epoch": 0.14726424185986076,
"grad_norm": 0.1806640625,
"learning_rate": 0.00019291055938594462,
"loss": 0.6404173374176025,
"mean_token_accuracy": 0.8303977962583303,
"num_tokens": 4552204.0,
"step": 850
},
{
"entropy": 0.6316783194430172,
"epoch": 0.1489967623523297,
"grad_norm": 0.2158203125,
"learning_rate": 0.00019270155780174114,
"loss": 0.656841516494751,
"mean_token_accuracy": 0.829747848957777,
"num_tokens": 4604813.0,
"step": 860
},
{
"entropy": 0.641633422859013,
"epoch": 0.15072928284479864,
"grad_norm": 0.1943359375,
"learning_rate": 0.00019248963664110288,
"loss": 0.6612475395202637,
"mean_token_accuracy": 0.8291548546403646,
"num_tokens": 4661699.0,
"step": 870
},
{
"entropy": 0.5630314766429365,
"epoch": 0.1524618033372676,
"grad_norm": 0.126953125,
"learning_rate": 0.00019227480257835163,
"loss": 0.5817951679229736,
"mean_token_accuracy": 0.8393433384597302,
"num_tokens": 4718774.0,
"step": 880
},
{
"entropy": 0.5991185949184,
"epoch": 0.15419432382973655,
"grad_norm": 0.126953125,
"learning_rate": 0.00019205706237954915,
"loss": 0.5823598861694336,
"mean_token_accuracy": 0.8372795689851046,
"num_tokens": 4772837.0,
"step": 890
},
{
"entropy": 0.6217554544098676,
"epoch": 0.1559268443222055,
"grad_norm": 0.1650390625,
"learning_rate": 0.00019183642290228415,
"loss": 0.6203337669372558,
"mean_token_accuracy": 0.8345170859247446,
"num_tokens": 4826993.0,
"step": 900
},
{
"entropy": 0.6516272252425551,
"epoch": 0.15765936481467444,
"grad_norm": 0.150390625,
"learning_rate": 0.00019161289109545618,
"loss": 0.6951152801513671,
"mean_token_accuracy": 0.8220154713839293,
"num_tokens": 4879529.0,
"step": 910
},
{
"entropy": 0.6168920679949224,
"epoch": 0.1593918853071434,
"grad_norm": 0.16796875,
"learning_rate": 0.000191386473999057,
"loss": 0.6254449844360351,
"mean_token_accuracy": 0.8336785022169352,
"num_tokens": 4936217.0,
"step": 920
},
{
"entropy": 0.6057372880168259,
"epoch": 0.16112440579961235,
"grad_norm": 0.2021484375,
"learning_rate": 0.00019115717874394856,
"loss": 0.5920339584350586,
"mean_token_accuracy": 0.8377459555864334,
"num_tokens": 4991428.0,
"step": 930
},
{
"entropy": 0.596577781997621,
"epoch": 0.1628569262920813,
"grad_norm": 0.1875,
"learning_rate": 0.00019092501255163873,
"loss": 0.6038323879241944,
"mean_token_accuracy": 0.8356593985110521,
"num_tokens": 5042620.0,
"step": 940
},
{
"entropy": 0.628834813600406,
"epoch": 0.16458944678455026,
"grad_norm": 0.140625,
"learning_rate": 0.00019068998273405363,
"loss": 0.611536693572998,
"mean_token_accuracy": 0.8292743604630232,
"num_tokens": 5095899.0,
"step": 950
},
{
"entropy": 0.6090147131122648,
"epoch": 0.1663219672770192,
"grad_norm": 0.216796875,
"learning_rate": 0.00019045209669330747,
"loss": 0.6397492408752441,
"mean_token_accuracy": 0.8378318089991807,
"num_tokens": 5145143.0,
"step": 960
},
{
"entropy": 0.6188279316294938,
"epoch": 0.16805448776948814,
"grad_norm": 0.2041015625,
"learning_rate": 0.00019021136192146933,
"loss": 0.6236711502075195,
"mean_token_accuracy": 0.8312609314918518,
"num_tokens": 5194365.0,
"step": 970
},
{
"entropy": 0.6223139866255224,
"epoch": 0.1697870082619571,
"grad_norm": 0.1533203125,
"learning_rate": 0.00018996778600032733,
"loss": 0.5912320137023925,
"mean_token_accuracy": 0.8325776852667331,
"num_tokens": 5249204.0,
"step": 980
},
{
"entropy": 0.6108009752351791,
"epoch": 0.17151952875442605,
"grad_norm": 0.2275390625,
"learning_rate": 0.00018972137660114977,
"loss": 0.6407642841339112,
"mean_token_accuracy": 0.8345553431659937,
"num_tokens": 5300027.0,
"step": 990
},
{
"entropy": 0.6413511738181115,
"epoch": 0.173252049246895,
"grad_norm": 0.2119140625,
"learning_rate": 0.00018947214148444346,
"loss": 0.6601122856140137,
"mean_token_accuracy": 0.8267729926854372,
"num_tokens": 5351314.0,
"step": 1000
},
{
"entropy": 0.6124841270968318,
"epoch": 0.17498456973936394,
"grad_norm": 0.1728515625,
"learning_rate": 0.00018922008849970947,
"loss": 0.6234911918640137,
"mean_token_accuracy": 0.8351690549403429,
"num_tokens": 5403143.0,
"step": 1010
},
{
"entropy": 0.5752321697305888,
"epoch": 0.1767170902318329,
"grad_norm": 0.1640625,
"learning_rate": 0.00018896522558519574,
"loss": 0.5731208801269532,
"mean_token_accuracy": 0.8450708810240031,
"num_tokens": 5452416.0,
"step": 1020
},
{
"entropy": 0.616970372479409,
"epoch": 0.17844961072430185,
"grad_norm": 0.158203125,
"learning_rate": 0.00018870756076764725,
"loss": 0.6389582633972168,
"mean_token_accuracy": 0.8294888816773891,
"num_tokens": 5507850.0,
"step": 1030
},
{
"entropy": 0.6209618886932731,
"epoch": 0.1801821312167708,
"grad_norm": 0.220703125,
"learning_rate": 0.00018844710216205305,
"loss": 0.5994563102722168,
"mean_token_accuracy": 0.8357018873095512,
"num_tokens": 5563755.0,
"step": 1040
},
{
"entropy": 0.5663943574763834,
"epoch": 0.18191465170923976,
"grad_norm": 0.173828125,
"learning_rate": 0.00018818385797139082,
"loss": 0.5874752044677735,
"mean_token_accuracy": 0.8382753696292639,
"num_tokens": 5615163.0,
"step": 1050
},
{
"entropy": 0.5496276264078915,
"epoch": 0.1836471722017087,
"grad_norm": 0.2080078125,
"learning_rate": 0.00018791783648636844,
"loss": 0.552100658416748,
"mean_token_accuracy": 0.847124283015728,
"num_tokens": 5666023.0,
"step": 1060
},
{
"entropy": 0.5882025823928416,
"epoch": 0.18537969269417764,
"grad_norm": 0.154296875,
"learning_rate": 0.00018764904608516286,
"loss": 0.5891311168670654,
"mean_token_accuracy": 0.8424473576247692,
"num_tokens": 5718586.0,
"step": 1070
},
{
"entropy": 0.5900297143496573,
"epoch": 0.1871122131866466,
"grad_norm": 0.193359375,
"learning_rate": 0.00018737749523315634,
"loss": 0.5772682189941406,
"mean_token_accuracy": 0.8354586530476809,
"num_tokens": 5773519.0,
"step": 1080
},
{
"entropy": 0.6208466733340174,
"epoch": 0.18884473367911556,
"grad_norm": 0.1806640625,
"learning_rate": 0.0001871031924826698,
"loss": 0.6123514652252198,
"mean_token_accuracy": 0.8369224779307842,
"num_tokens": 5826864.0,
"step": 1090
},
{
"entropy": 0.6265057612210512,
"epoch": 0.1905772541715845,
"grad_norm": 0.2216796875,
"learning_rate": 0.00018682614647269337,
"loss": 0.6527121067047119,
"mean_token_accuracy": 0.8279910124838352,
"num_tokens": 5883460.0,
"step": 1100
},
{
"entropy": 0.6124740152154118,
"epoch": 0.19230977466405344,
"grad_norm": 0.1865234375,
"learning_rate": 0.00018654636592861442,
"loss": 0.601304292678833,
"mean_token_accuracy": 0.837521544471383,
"num_tokens": 5935188.0,
"step": 1110
},
{
"entropy": 0.6669362563639879,
"epoch": 0.1940422951565224,
"grad_norm": 0.1669921875,
"learning_rate": 0.00018626385966194275,
"loss": 0.6994386196136475,
"mean_token_accuracy": 0.8204180236905814,
"num_tokens": 5990812.0,
"step": 1120
},
{
"entropy": 0.5861103215254844,
"epoch": 0.19577481564899135,
"grad_norm": 0.1455078125,
"learning_rate": 0.00018597863657003301,
"loss": 0.596555233001709,
"mean_token_accuracy": 0.8415500700473786,
"num_tokens": 6046076.0,
"step": 1130
},
{
"entropy": 0.574791920511052,
"epoch": 0.1975073361414603,
"grad_norm": 0.2392578125,
"learning_rate": 0.00018569070563580464,
"loss": 0.5656003952026367,
"mean_token_accuracy": 0.84433070756495,
"num_tokens": 6096184.0,
"step": 1140
},
{
"entropy": 0.5880047191400081,
"epoch": 0.19923985663392924,
"grad_norm": 0.1826171875,
"learning_rate": 0.00018540007592745864,
"loss": 0.6296281337738037,
"mean_token_accuracy": 0.8372744925320148,
"num_tokens": 6150146.0,
"step": 1150
},
{
"entropy": 0.6163527581840753,
"epoch": 0.2009723771263982,
"grad_norm": 0.22265625,
"learning_rate": 0.0001851067565981924,
"loss": 0.6186246395111084,
"mean_token_accuracy": 0.8372070085257292,
"num_tokens": 6204194.0,
"step": 1160
},
{
"entropy": 0.6072378985583782,
"epoch": 0.20270489761886715,
"grad_norm": 0.2109375,
"learning_rate": 0.00018481075688591103,
"loss": 0.6095839023590088,
"mean_token_accuracy": 0.838889866694808,
"num_tokens": 6258705.0,
"step": 1170
},
{
"entropy": 0.6074762488715351,
"epoch": 0.2044374181113361,
"grad_norm": 0.193359375,
"learning_rate": 0.0001845120861129367,
"loss": 0.5899257659912109,
"mean_token_accuracy": 0.8360508769750595,
"num_tokens": 6307059.0,
"step": 1180
},
{
"entropy": 0.641719778161496,
"epoch": 0.20616993860380506,
"grad_norm": 0.1865234375,
"learning_rate": 0.00018421075368571494,
"loss": 0.6559735298156738,
"mean_token_accuracy": 0.8301095329225063,
"num_tokens": 6358072.0,
"step": 1190
},
{
"entropy": 0.5920701253227889,
"epoch": 0.207902459096274,
"grad_norm": 0.1845703125,
"learning_rate": 0.0001839067690945183,
"loss": 0.6020590782165527,
"mean_token_accuracy": 0.8376339256763459,
"num_tokens": 6410083.0,
"step": 1200
},
{
"entropy": 0.6142618627287447,
"epoch": 0.20963497958874294,
"grad_norm": 0.2119140625,
"learning_rate": 0.0001836001419131476,
"loss": 0.6106932640075684,
"mean_token_accuracy": 0.8338899418711663,
"num_tokens": 6463508.0,
"step": 1210
},
{
"entropy": 0.6488701615482568,
"epoch": 0.21136750008121188,
"grad_norm": 0.1669921875,
"learning_rate": 0.00018329088179863033,
"loss": 0.6356019973754883,
"mean_token_accuracy": 0.8337765200063586,
"num_tokens": 6523476.0,
"step": 1220
},
{
"entropy": 0.6172928042709828,
"epoch": 0.21310002057368085,
"grad_norm": 0.1728515625,
"learning_rate": 0.00018297899849091656,
"loss": 0.6405450344085694,
"mean_token_accuracy": 0.8321660306304693,
"num_tokens": 6573355.0,
"step": 1230
},
{
"entropy": 0.621446970757097,
"epoch": 0.2148325410661498,
"grad_norm": 0.177734375,
"learning_rate": 0.0001826645018125721,
"loss": 0.6622963428497315,
"mean_token_accuracy": 0.8254197046160698,
"num_tokens": 6622895.0,
"step": 1240
},
{
"entropy": 0.6129778816364706,
"epoch": 0.21656506155861874,
"grad_norm": 0.16015625,
"learning_rate": 0.00018234740166846929,
"loss": 0.5634833335876465,
"mean_token_accuracy": 0.8355090744793415,
"num_tokens": 6679834.0,
"step": 1250
},
{
"entropy": 0.6156612957827747,
"epoch": 0.2182975820510877,
"grad_norm": 0.1640625,
"learning_rate": 0.00018202770804547492,
"loss": 0.6147466659545898,
"mean_token_accuracy": 0.8310359807685017,
"num_tokens": 6731484.0,
"step": 1260
},
{
"entropy": 0.5810929948464036,
"epoch": 0.22003010254355665,
"grad_norm": 0.189453125,
"learning_rate": 0.00018170543101213565,
"loss": 0.5630557537078857,
"mean_token_accuracy": 0.8407821863889694,
"num_tokens": 6787191.0,
"step": 1270
},
{
"entropy": 0.6104231233242899,
"epoch": 0.2217626230360256,
"grad_norm": 0.1943359375,
"learning_rate": 0.00018138058071836115,
"loss": 0.621036958694458,
"mean_token_accuracy": 0.8329197008162736,
"num_tokens": 6840606.0,
"step": 1280
},
{
"entropy": 0.6128938837908209,
"epoch": 0.22349514352849456,
"grad_norm": 0.21484375,
"learning_rate": 0.00018105316739510424,
"loss": 0.5915724754333496,
"mean_token_accuracy": 0.8370759826153517,
"num_tokens": 6887163.0,
"step": 1290
},
{
"entropy": 0.5851812950335443,
"epoch": 0.2252276640209635,
"grad_norm": 0.2236328125,
"learning_rate": 0.00018072320135403862,
"loss": 0.5940948963165283,
"mean_token_accuracy": 0.8384971469640732,
"num_tokens": 6940242.0,
"step": 1300
},
{
"entropy": 0.5889422579668462,
"epoch": 0.22696018451343244,
"grad_norm": 0.21875,
"learning_rate": 0.00018039069298723435,
"loss": 0.5769166946411133,
"mean_token_accuracy": 0.8388250943273305,
"num_tokens": 6996198.0,
"step": 1310
},
{
"entropy": 0.606858121138066,
"epoch": 0.2286927050059014,
"grad_norm": 0.1552734375,
"learning_rate": 0.00018005565276683037,
"loss": 0.6112150192260742,
"mean_token_accuracy": 0.8364918135106564,
"num_tokens": 7048115.0,
"step": 1320
},
{
"entropy": 0.5949655521195382,
"epoch": 0.23042522549837036,
"grad_norm": 0.2470703125,
"learning_rate": 0.00017971809124470468,
"loss": 0.6120047569274902,
"mean_token_accuracy": 0.8407701279968023,
"num_tokens": 7108085.0,
"step": 1330
},
{
"entropy": 0.6079389780759812,
"epoch": 0.2321577459908393,
"grad_norm": 0.16015625,
"learning_rate": 0.00017937801905214214,
"loss": 0.6000718593597412,
"mean_token_accuracy": 0.8364381536841392,
"num_tokens": 7162152.0,
"step": 1340
},
{
"entropy": 0.6189309723675251,
"epoch": 0.23389026648330824,
"grad_norm": 0.2275390625,
"learning_rate": 0.00017903544689949953,
"loss": 0.6147403240203857,
"mean_token_accuracy": 0.8258390601724386,
"num_tokens": 7213480.0,
"step": 1350
},
{
"entropy": 0.5935845918487758,
"epoch": 0.2356227869757772,
"grad_norm": 0.244140625,
"learning_rate": 0.00017869038557586834,
"loss": 0.594597339630127,
"mean_token_accuracy": 0.8422905754297971,
"num_tokens": 7268365.0,
"step": 1360
},
{
"entropy": 0.5886939469724893,
"epoch": 0.23735530746824615,
"grad_norm": 0.1796875,
"learning_rate": 0.00017834284594873476,
"loss": 0.5968518257141113,
"mean_token_accuracy": 0.839365403354168,
"num_tokens": 7322788.0,
"step": 1370
},
{
"entropy": 0.5890856982208789,
"epoch": 0.2390878279607151,
"grad_norm": 0.20703125,
"learning_rate": 0.00017799283896363776,
"loss": 0.5831431388854981,
"mean_token_accuracy": 0.8419708486646413,
"num_tokens": 7378087.0,
"step": 1380
},
{
"entropy": 0.6064389856532216,
"epoch": 0.24082034845318404,
"grad_norm": 0.26171875,
"learning_rate": 0.00017764037564382408,
"loss": 0.6195587635040283,
"mean_token_accuracy": 0.8357837244868278,
"num_tokens": 7432262.0,
"step": 1390
},
{
"entropy": 0.5797448608092963,
"epoch": 0.242552868945653,
"grad_norm": 0.1826171875,
"learning_rate": 0.00017728546708990113,
"loss": 0.6022681713104248,
"mean_token_accuracy": 0.8418242033571005,
"num_tokens": 7489537.0,
"step": 1400
},
{
"entropy": 0.585219320608303,
"epoch": 0.24428538943812195,
"grad_norm": 0.1494140625,
"learning_rate": 0.0001769281244794875,
"loss": 0.601930570602417,
"mean_token_accuracy": 0.8405182551592588,
"num_tokens": 7545283.0,
"step": 1410
},
{
"entropy": 0.6301440540701151,
"epoch": 0.2460179099305909,
"grad_norm": 0.16796875,
"learning_rate": 0.0001765683590668607,
"loss": 0.617746639251709,
"mean_token_accuracy": 0.8311772037297487,
"num_tokens": 7599954.0,
"step": 1420
},
{
"entropy": 0.5862551515456289,
"epoch": 0.24775043042305986,
"grad_norm": 0.1494140625,
"learning_rate": 0.000176206182182603,
"loss": 0.5854514122009278,
"mean_token_accuracy": 0.8412911489605903,
"num_tokens": 7651135.0,
"step": 1430
},
{
"entropy": 0.6006224121898412,
"epoch": 0.2494829509155288,
"grad_norm": 0.2451171875,
"learning_rate": 0.00017584160523324437,
"loss": 0.626686954498291,
"mean_token_accuracy": 0.8344044268131257,
"num_tokens": 7701714.0,
"step": 1440
},
{
"entropy": 0.6094549149740487,
"epoch": 0.25121547140799777,
"grad_norm": 0.220703125,
"learning_rate": 0.00017547463970090323,
"loss": 0.5837365627288819,
"mean_token_accuracy": 0.8370290040969849,
"num_tokens": 7755256.0,
"step": 1450
},
{
"entropy": 0.5964161755517126,
"epoch": 0.2529479919004667,
"grad_norm": 0.158203125,
"learning_rate": 0.00017510529714292496,
"loss": 0.5807624340057373,
"mean_token_accuracy": 0.8389873761683703,
"num_tokens": 7805875.0,
"step": 1460
},
{
"entropy": 0.5798287321813405,
"epoch": 0.25468051239293565,
"grad_norm": 0.177734375,
"learning_rate": 0.0001747335891915179,
"loss": 0.6037708759307862,
"mean_token_accuracy": 0.8360363617539406,
"num_tokens": 7857904.0,
"step": 1470
},
{
"entropy": 0.6185758833307773,
"epoch": 0.2564130328854046,
"grad_norm": 0.203125,
"learning_rate": 0.00017435952755338684,
"loss": 0.6310105323791504,
"mean_token_accuracy": 0.8346008766442538,
"num_tokens": 7911115.0,
"step": 1480
},
{
"entropy": 0.5521081209182739,
"epoch": 0.25814555337787354,
"grad_norm": 0.158203125,
"learning_rate": 0.00017398312400936452,
"loss": 0.5405902862548828,
"mean_token_accuracy": 0.8503412056714297,
"num_tokens": 7961113.0,
"step": 1490
},
{
"entropy": 0.6125838646665216,
"epoch": 0.2598780738703425,
"grad_norm": 0.224609375,
"learning_rate": 0.00017360439041404045,
"loss": 0.6419179439544678,
"mean_token_accuracy": 0.831499756872654,
"num_tokens": 8016836.0,
"step": 1500
},
{
"entropy": 0.6090016840025783,
"epoch": 0.2616105943628114,
"grad_norm": 0.16796875,
"learning_rate": 0.0001732233386953877,
"loss": 0.6156506061553955,
"mean_token_accuracy": 0.8323286134749651,
"num_tokens": 8069126.0,
"step": 1510
},
{
"entropy": 0.5781607817858457,
"epoch": 0.2633431148552804,
"grad_norm": 0.166015625,
"learning_rate": 0.000172839980854387,
"loss": 0.5711768627166748,
"mean_token_accuracy": 0.8443056184798479,
"num_tokens": 8121984.0,
"step": 1520
},
{
"entropy": 0.6185290202964098,
"epoch": 0.26507563534774936,
"grad_norm": 0.2177734375,
"learning_rate": 0.0001724543289646491,
"loss": 0.6232064247131348,
"mean_token_accuracy": 0.8340055584907532,
"num_tokens": 8174853.0,
"step": 1530
},
{
"entropy": 0.5681716504506766,
"epoch": 0.2668081558402183,
"grad_norm": 0.201171875,
"learning_rate": 0.0001720663951720343,
"loss": 0.5704017162322998,
"mean_token_accuracy": 0.8463324144482612,
"num_tokens": 8230103.0,
"step": 1540
},
{
"entropy": 0.6060013690497726,
"epoch": 0.26854067633268724,
"grad_norm": 0.203125,
"learning_rate": 0.00017167619169426997,
"loss": 0.6261486053466797,
"mean_token_accuracy": 0.8349693570286035,
"num_tokens": 8285159.0,
"step": 1550
},
{
"entropy": 0.5899374564178288,
"epoch": 0.2702731968251562,
"grad_norm": 0.1748046875,
"learning_rate": 0.00017128373082056565,
"loss": 0.5784136772155761,
"mean_token_accuracy": 0.834688114002347,
"num_tokens": 8339683.0,
"step": 1560
},
{
"entropy": 0.600262654479593,
"epoch": 0.27200571731762513,
"grad_norm": 0.232421875,
"learning_rate": 0.00017088902491122637,
"loss": 0.6100976943969727,
"mean_token_accuracy": 0.8409205380827188,
"num_tokens": 8392860.0,
"step": 1570
},
{
"entropy": 0.6050844821147621,
"epoch": 0.2737382378100941,
"grad_norm": 0.171875,
"learning_rate": 0.0001704920863972629,
"loss": 0.6370552539825439,
"mean_token_accuracy": 0.833171795681119,
"num_tokens": 8444381.0,
"step": 1580
},
{
"entropy": 0.622040162421763,
"epoch": 0.27547075830256307,
"grad_norm": 0.1572265625,
"learning_rate": 0.00017009292778000056,
"loss": 0.6550620555877685,
"mean_token_accuracy": 0.8347457438707352,
"num_tokens": 8500064.0,
"step": 1590
},
{
"entropy": 0.5820012846495957,
"epoch": 0.277203278795032,
"grad_norm": 0.1826171875,
"learning_rate": 0.00016969156163068548,
"loss": 0.5726365089416504,
"mean_token_accuracy": 0.8414584957063198,
"num_tokens": 8554413.0,
"step": 1600
},
{
"entropy": 0.6192501490004361,
"epoch": 0.27893579928750095,
"grad_norm": 0.240234375,
"learning_rate": 0.0001692880005900884,
"loss": 0.6141728401184082,
"mean_token_accuracy": 0.8348658731207251,
"num_tokens": 8608546.0,
"step": 1610
},
{
"entropy": 0.5944610396865755,
"epoch": 0.2806683197799699,
"grad_norm": 0.2001953125,
"learning_rate": 0.00016888225736810702,
"loss": 0.5792739868164063,
"mean_token_accuracy": 0.8423636559396982,
"num_tokens": 8661380.0,
"step": 1620
},
{
"entropy": 0.5956152304075658,
"epoch": 0.28240084027243884,
"grad_norm": 0.2099609375,
"learning_rate": 0.00016847434474336528,
"loss": 0.5970348358154297,
"mean_token_accuracy": 0.8401257161051034,
"num_tokens": 8709577.0,
"step": 1630
},
{
"entropy": 0.6147611321881413,
"epoch": 0.2841333607649078,
"grad_norm": 0.1884765625,
"learning_rate": 0.00016806427556281106,
"loss": 0.629329776763916,
"mean_token_accuracy": 0.8385975230485201,
"num_tokens": 8761040.0,
"step": 1640
},
{
"entropy": 0.6490127250086516,
"epoch": 0.2858658812573768,
"grad_norm": 0.2080078125,
"learning_rate": 0.0001676520627413117,
"loss": 0.6809987545013427,
"mean_token_accuracy": 0.8295384451746941,
"num_tokens": 8815974.0,
"step": 1650
},
{
"entropy": 0.5769906338769942,
"epoch": 0.2875984017498457,
"grad_norm": 0.181640625,
"learning_rate": 0.00016723771926124706,
"loss": 0.6031839847564697,
"mean_token_accuracy": 0.8421449929475784,
"num_tokens": 8864858.0,
"step": 1660
},
{
"entropy": 0.5643401111476123,
"epoch": 0.28933092224231466,
"grad_norm": 0.1650390625,
"learning_rate": 0.0001668212581721008,
"loss": 0.5524356365203857,
"mean_token_accuracy": 0.8459334097802639,
"num_tokens": 8917743.0,
"step": 1670
},
{
"entropy": 0.5941579655511304,
"epoch": 0.2910634427347836,
"grad_norm": 0.1484375,
"learning_rate": 0.0001664026925900492,
"loss": 0.6215604782104492,
"mean_token_accuracy": 0.8360832681879401,
"num_tokens": 8974177.0,
"step": 1680
},
{
"entropy": 0.6097073512617499,
"epoch": 0.29279596322725254,
"grad_norm": 0.1953125,
"learning_rate": 0.00016598203569754842,
"loss": 0.6148754119873047,
"mean_token_accuracy": 0.8349464479833841,
"num_tokens": 9029784.0,
"step": 1690
},
{
"entropy": 0.5949376497417689,
"epoch": 0.2945284837197215,
"grad_norm": 0.171875,
"learning_rate": 0.00016555930074291892,
"loss": 0.5629282474517823,
"mean_token_accuracy": 0.8412305314093829,
"num_tokens": 9086247.0,
"step": 1700
},
{
"entropy": 0.6209503551013767,
"epoch": 0.2962610042121904,
"grad_norm": 0.1728515625,
"learning_rate": 0.00016513450103992843,
"loss": 0.6351428508758545,
"mean_token_accuracy": 0.8299500808119774,
"num_tokens": 9139348.0,
"step": 1710
},
{
"entropy": 0.6122556574642658,
"epoch": 0.2979935247046594,
"grad_norm": 0.259765625,
"learning_rate": 0.0001647076499673727,
"loss": 0.6054322719573975,
"mean_token_accuracy": 0.8361066952347755,
"num_tokens": 9189774.0,
"step": 1720
},
{
"entropy": 0.6057383619248867,
"epoch": 0.29972604519712837,
"grad_norm": 0.166015625,
"learning_rate": 0.00016427876096865394,
"loss": 0.5783013820648193,
"mean_token_accuracy": 0.8409923903644085,
"num_tokens": 9247091.0,
"step": 1730
},
{
"entropy": 0.6327047647442668,
"epoch": 0.3014585656895973,
"grad_norm": 0.1708984375,
"learning_rate": 0.00016384784755135766,
"loss": 0.6669343471527099,
"mean_token_accuracy": 0.8293208103626967,
"num_tokens": 9302230.0,
"step": 1740
},
{
"entropy": 0.5699484588578343,
"epoch": 0.30319108618206625,
"grad_norm": 0.2119140625,
"learning_rate": 0.00016341492328682703,
"loss": 0.5571082592010498,
"mean_token_accuracy": 0.8480747263878584,
"num_tokens": 9356728.0,
"step": 1750
},
{
"entropy": 0.567579479701817,
"epoch": 0.3049236066745352,
"grad_norm": 0.1962890625,
"learning_rate": 0.00016298000180973573,
"loss": 0.5580705165863037,
"mean_token_accuracy": 0.8437619034200907,
"num_tokens": 9408140.0,
"step": 1760
},
{
"entropy": 0.5828627380309627,
"epoch": 0.30665612716700413,
"grad_norm": 0.18359375,
"learning_rate": 0.00016254309681765813,
"loss": 0.5716603755950928,
"mean_token_accuracy": 0.8377308517694473,
"num_tokens": 9467463.0,
"step": 1770
},
{
"entropy": 0.5848529391689226,
"epoch": 0.3083886476594731,
"grad_norm": 0.158203125,
"learning_rate": 0.0001621042220706384,
"loss": 0.5793115139007569,
"mean_token_accuracy": 0.8402173619717359,
"num_tokens": 9522306.0,
"step": 1780
},
{
"entropy": 0.6066678614355624,
"epoch": 0.3101211681519421,
"grad_norm": 0.1591796875,
"learning_rate": 0.00016166339139075676,
"loss": 0.6328657627105713,
"mean_token_accuracy": 0.8367021255195141,
"num_tokens": 9572434.0,
"step": 1790
},
{
"entropy": 0.6003833622671664,
"epoch": 0.311853688644411,
"grad_norm": 0.2119140625,
"learning_rate": 0.0001612206186616942,
"loss": 0.6137086391448975,
"mean_token_accuracy": 0.8334165547043085,
"num_tokens": 9628519.0,
"step": 1800
},
{
"entropy": 0.590199672896415,
"epoch": 0.31358620913687996,
"grad_norm": 0.185546875,
"learning_rate": 0.00016077591782829548,
"loss": 0.5786579608917236,
"mean_token_accuracy": 0.8455715507268906,
"num_tokens": 9681885.0,
"step": 1810
},
{
"entropy": 0.5942349970573559,
"epoch": 0.31531872962934887,
"grad_norm": 0.203125,
"learning_rate": 0.00016032930289612972,
"loss": 0.603551721572876,
"mean_token_accuracy": 0.8380775325000286,
"num_tokens": 9731757.0,
"step": 1820
},
{
"entropy": 0.6340034159831702,
"epoch": 0.31705125012181784,
"grad_norm": 0.2255859375,
"learning_rate": 0.0001598807879310493,
"loss": 0.6752604007720947,
"mean_token_accuracy": 0.8293415606021881,
"num_tokens": 9784377.0,
"step": 1830
},
{
"entropy": 0.6373454562388361,
"epoch": 0.3187837706142868,
"grad_norm": 0.1728515625,
"learning_rate": 0.000159430387058747,
"loss": 0.6538397312164307,
"mean_token_accuracy": 0.8350980304181576,
"num_tokens": 9834147.0,
"step": 1840
},
{
"entropy": 0.5898376687895507,
"epoch": 0.3205162911067557,
"grad_norm": 0.1767578125,
"learning_rate": 0.00015897811446431094,
"loss": 0.5761978149414062,
"mean_token_accuracy": 0.8405380714684725,
"num_tokens": 9886125.0,
"step": 1850
},
{
"entropy": 0.6033100615255534,
"epoch": 0.3222488115992247,
"grad_norm": 0.1953125,
"learning_rate": 0.00015852398439177812,
"loss": 0.6355989933013916,
"mean_token_accuracy": 0.8382335666567087,
"num_tokens": 9938648.0,
"step": 1860
},
{
"entropy": 0.5812505614478141,
"epoch": 0.32398133209169366,
"grad_norm": 0.1689453125,
"learning_rate": 0.00015806801114368543,
"loss": 0.6040312290191651,
"mean_token_accuracy": 0.8389291629195214,
"num_tokens": 9990548.0,
"step": 1870
},
{
"entropy": 0.5965979805681855,
"epoch": 0.3257138525841626,
"grad_norm": 0.22265625,
"learning_rate": 0.00015761020908061947,
"loss": 0.6084609985351562,
"mean_token_accuracy": 0.8397494804114103,
"num_tokens": 10043712.0,
"step": 1880
},
{
"entropy": 0.6055567375849933,
"epoch": 0.32744637307663155,
"grad_norm": 0.2119140625,
"learning_rate": 0.0001571505926207643,
"loss": 0.5824664115905762,
"mean_token_accuracy": 0.8369629330933094,
"num_tokens": 10098633.0,
"step": 1890
},
{
"entropy": 0.622294892789796,
"epoch": 0.3291788935691005,
"grad_norm": 0.29296875,
"learning_rate": 0.0001566891762394471,
"loss": 0.6370018005371094,
"mean_token_accuracy": 0.8303959008306265,
"num_tokens": 10152668.0,
"step": 1900
},
{
"entropy": 0.6205999419093132,
"epoch": 0.33091141406156943,
"grad_norm": 0.1826171875,
"learning_rate": 0.00015622597446868252,
"loss": 0.6031853199005127,
"mean_token_accuracy": 0.839716836810112,
"num_tokens": 10203981.0,
"step": 1910
},
{
"entropy": 0.5835219689644873,
"epoch": 0.3326439345540384,
"grad_norm": 0.2099609375,
"learning_rate": 0.00015576100189671488,
"loss": 0.583237886428833,
"mean_token_accuracy": 0.8391559388488531,
"num_tokens": 10256722.0,
"step": 1920
},
{
"entropy": 0.5798515821807086,
"epoch": 0.33437645504650737,
"grad_norm": 0.1630859375,
"learning_rate": 0.00015529427316755874,
"loss": 0.621484899520874,
"mean_token_accuracy": 0.8355384927242995,
"num_tokens": 10310185.0,
"step": 1930
},
{
"entropy": 0.5843613225501031,
"epoch": 0.3361089755389763,
"grad_norm": 0.236328125,
"learning_rate": 0.00015482580298053778,
"loss": 0.6080245018005371,
"mean_token_accuracy": 0.842098330333829,
"num_tokens": 10365812.0,
"step": 1940
},
{
"entropy": 0.5864246059209108,
"epoch": 0.33784149603144525,
"grad_norm": 0.228515625,
"learning_rate": 0.00015435560608982168,
"loss": 0.5887944221496582,
"mean_token_accuracy": 0.8388173773884773,
"num_tokens": 10420413.0,
"step": 1950
},
{
"entropy": 0.5741982539650052,
"epoch": 0.3395740165239142,
"grad_norm": 0.171875,
"learning_rate": 0.0001538836973039616,
"loss": 0.5880287647247314,
"mean_token_accuracy": 0.8398171707987785,
"num_tokens": 10477056.0,
"step": 1960
},
{
"entropy": 0.6004749670159072,
"epoch": 0.34130653701638314,
"grad_norm": 0.201171875,
"learning_rate": 0.00015341009148542377,
"loss": 0.619431734085083,
"mean_token_accuracy": 0.8380085773766041,
"num_tokens": 10530758.0,
"step": 1970
},
{
"entropy": 0.5911483001895249,
"epoch": 0.3430390575088521,
"grad_norm": 0.216796875,
"learning_rate": 0.00015293480355012138,
"loss": 0.5825908660888672,
"mean_token_accuracy": 0.8379138492047786,
"num_tokens": 10586548.0,
"step": 1980
},
{
"entropy": 0.5724553103093057,
"epoch": 0.344771578001321,
"grad_norm": 0.1640625,
"learning_rate": 0.0001524578484669448,
"loss": 0.5837036609649658,
"mean_token_accuracy": 0.8414458900690078,
"num_tokens": 10640208.0,
"step": 1990
},
{
"entropy": 0.5913511055056005,
"epoch": 0.34650409849379,
"grad_norm": 0.2294921875,
"learning_rate": 0.00015197924125729016,
"loss": 0.6037324905395508,
"mean_token_accuracy": 0.8375172037631273,
"num_tokens": 10689070.0,
"step": 2000
},
{
"entropy": 0.5623359635006636,
"epoch": 0.34823661898625896,
"grad_norm": 0.26171875,
"learning_rate": 0.0001514989969945862,
"loss": 0.5799863815307618,
"mean_token_accuracy": 0.8434689830988645,
"num_tokens": 10741791.0,
"step": 2010
},
{
"entropy": 0.595218509202823,
"epoch": 0.3499691394787279,
"grad_norm": 0.2021484375,
"learning_rate": 0.0001510171308038197,
"loss": 0.5759833335876465,
"mean_token_accuracy": 0.8378583282232285,
"num_tokens": 10792017.0,
"step": 2020
},
{
"entropy": 0.5926129624480382,
"epoch": 0.35170165997119684,
"grad_norm": 0.275390625,
"learning_rate": 0.00015053365786105898,
"loss": 0.6137632369995117,
"mean_token_accuracy": 0.8360541388392448,
"num_tokens": 10841822.0,
"step": 2030
},
{
"entropy": 0.588808442093432,
"epoch": 0.3534341804636658,
"grad_norm": 0.1669921875,
"learning_rate": 0.00015004859339297602,
"loss": 0.6234822750091553,
"mean_token_accuracy": 0.8365503929555416,
"num_tokens": 10895402.0,
"step": 2040
},
{
"entropy": 0.6277590793790295,
"epoch": 0.35516670095613473,
"grad_norm": 0.171875,
"learning_rate": 0.0001495619526763668,
"loss": 0.6404668807983398,
"mean_token_accuracy": 0.8322111006826163,
"num_tokens": 10948926.0,
"step": 2050
},
{
"entropy": 0.5735611078329385,
"epoch": 0.3568992214486037,
"grad_norm": 0.2138671875,
"learning_rate": 0.00014907375103767037,
"loss": 0.554630708694458,
"mean_token_accuracy": 0.8440061457455158,
"num_tokens": 11001006.0,
"step": 2060
},
{
"entropy": 0.582486811466515,
"epoch": 0.35863174194107267,
"grad_norm": 0.26171875,
"learning_rate": 0.00014858400385248585,
"loss": 0.565306568145752,
"mean_token_accuracy": 0.8428201846778393,
"num_tokens": 11057715.0,
"step": 2070
},
{
"entropy": 0.5820039538666606,
"epoch": 0.3603642624335416,
"grad_norm": 0.259765625,
"learning_rate": 0.00014809272654508855,
"loss": 0.5647046089172363,
"mean_token_accuracy": 0.8435172945261001,
"num_tokens": 11105950.0,
"step": 2080
},
{
"entropy": 0.6123531493823975,
"epoch": 0.36209678292601055,
"grad_norm": 0.18359375,
"learning_rate": 0.00014759993458794387,
"loss": 0.6230340003967285,
"mean_token_accuracy": 0.8300592731684446,
"num_tokens": 11159753.0,
"step": 2090
},
{
"entropy": 0.586882522655651,
"epoch": 0.3638293034184795,
"grad_norm": 0.2119140625,
"learning_rate": 0.00014710564350122021,
"loss": 0.5888068199157714,
"mean_token_accuracy": 0.8437575984746217,
"num_tokens": 11217212.0,
"step": 2100
},
{
"entropy": 0.5973215179517866,
"epoch": 0.36556182391094844,
"grad_norm": 0.19921875,
"learning_rate": 0.00014660986885230002,
"loss": 0.6102025032043457,
"mean_token_accuracy": 0.8387055590748786,
"num_tokens": 11269879.0,
"step": 2110
},
{
"entropy": 0.5769942476414144,
"epoch": 0.3672943444034174,
"grad_norm": 0.2392578125,
"learning_rate": 0.0001461126262552897,
"loss": 0.577931547164917,
"mean_token_accuracy": 0.8404097493737936,
"num_tokens": 11319324.0,
"step": 2120
},
{
"entropy": 0.6094427598174661,
"epoch": 0.3690268648958863,
"grad_norm": 0.140625,
"learning_rate": 0.00014561393137052766,
"loss": 0.6362490653991699,
"mean_token_accuracy": 0.8333139736205339,
"num_tokens": 11375159.0,
"step": 2130
},
{
"entropy": 0.5666341712232679,
"epoch": 0.3707593853883553,
"grad_norm": 0.216796875,
"learning_rate": 0.00014511379990409117,
"loss": 0.567043685913086,
"mean_token_accuracy": 0.8457438841462135,
"num_tokens": 11426520.0,
"step": 2140
},
{
"entropy": 0.6225775457452982,
"epoch": 0.37249190588082426,
"grad_norm": 0.2216796875,
"learning_rate": 0.00014461224760730187,
"loss": 0.6647164821624756,
"mean_token_accuracy": 0.8330285247415304,
"num_tokens": 11484237.0,
"step": 2150
},
{
"entropy": 0.6187613100279122,
"epoch": 0.3742244263732932,
"grad_norm": 0.2314453125,
"learning_rate": 0.00014410929027622934,
"loss": 0.6382776260375976,
"mean_token_accuracy": 0.8337401654571295,
"num_tokens": 11536870.0,
"step": 2160
},
{
"entropy": 0.6030611063353717,
"epoch": 0.37595694686576214,
"grad_norm": 0.1806640625,
"learning_rate": 0.00014360494375119395,
"loss": 0.5975234508514404,
"mean_token_accuracy": 0.8363439656794072,
"num_tokens": 11584488.0,
"step": 2170
},
{
"entropy": 0.6093014625832438,
"epoch": 0.3776894673582311,
"grad_norm": 0.240234375,
"learning_rate": 0.00014309922391626784,
"loss": 0.6156137943267822,
"mean_token_accuracy": 0.8362408101558685,
"num_tokens": 11639837.0,
"step": 2180
},
{
"entropy": 0.6037656621308998,
"epoch": 0.3794219878507,
"grad_norm": 0.24609375,
"learning_rate": 0.0001425921466987746,
"loss": 0.5895677089691163,
"mean_token_accuracy": 0.8392930574715137,
"num_tokens": 11691666.0,
"step": 2190
},
{
"entropy": 0.5695399052929133,
"epoch": 0.381154508343169,
"grad_norm": 0.181640625,
"learning_rate": 0.00014208372806878784,
"loss": 0.5762203693389892,
"mean_token_accuracy": 0.8463476520031691,
"num_tokens": 11744574.0,
"step": 2200
},
{
"entropy": 0.5971330104395747,
"epoch": 0.38288702883563797,
"grad_norm": 0.212890625,
"learning_rate": 0.00014157398403862793,
"loss": 0.610533332824707,
"mean_token_accuracy": 0.8361469194293022,
"num_tokens": 11803183.0,
"step": 2210
},
{
"entropy": 0.6277089732699096,
"epoch": 0.3846195493281069,
"grad_norm": 0.171875,
"learning_rate": 0.00014106293066235806,
"loss": 0.6349636077880859,
"mean_token_accuracy": 0.8273304011672735,
"num_tokens": 11853042.0,
"step": 2220
},
{
"entropy": 0.6195264323614538,
"epoch": 0.38635206982057585,
"grad_norm": 0.17578125,
"learning_rate": 0.00014055058403527828,
"loss": 0.6387957572937012,
"mean_token_accuracy": 0.8352078393101692,
"num_tokens": 11907577.0,
"step": 2230
},
{
"entropy": 0.5621367298997939,
"epoch": 0.3880845903130448,
"grad_norm": 0.27734375,
"learning_rate": 0.00014003696029341885,
"loss": 0.5445407390594482,
"mean_token_accuracy": 0.8438704308122397,
"num_tokens": 11964072.0,
"step": 2240
},
{
"entropy": 0.5822187520563602,
"epoch": 0.38981711080551373,
"grad_norm": 0.1904296875,
"learning_rate": 0.00013952207561303186,
"loss": 0.5968410491943359,
"mean_token_accuracy": 0.8352361563593149,
"num_tokens": 12018364.0,
"step": 2250
},
{
"entropy": 0.5926231760531664,
"epoch": 0.3915496312979827,
"grad_norm": 0.1845703125,
"learning_rate": 0.000139005946210082,
"loss": 0.5886177539825439,
"mean_token_accuracy": 0.8381821203976869,
"num_tokens": 12071181.0,
"step": 2260
},
{
"entropy": 0.6001140361186117,
"epoch": 0.3932821517904517,
"grad_norm": 0.1796875,
"learning_rate": 0.00013848858833973555,
"loss": 0.5883821487426758,
"mean_token_accuracy": 0.8341061566025019,
"num_tokens": 12123527.0,
"step": 2270
},
{
"entropy": 0.6000702895224095,
"epoch": 0.3950146722829206,
"grad_norm": 0.2470703125,
"learning_rate": 0.00013797001829584868,
"loss": 0.6160523891448975,
"mean_token_accuracy": 0.8381300024688244,
"num_tokens": 12179785.0,
"step": 2280
},
{
"entropy": 0.5846447445452213,
"epoch": 0.39674719277538956,
"grad_norm": 0.2041015625,
"learning_rate": 0.00013745025241045412,
"loss": 0.5964017868041992,
"mean_token_accuracy": 0.840913362056017,
"num_tokens": 12233504.0,
"step": 2290
},
{
"entropy": 0.5862786662764847,
"epoch": 0.39847971326785847,
"grad_norm": 0.205078125,
"learning_rate": 0.00013692930705324697,
"loss": 0.607056713104248,
"mean_token_accuracy": 0.8370703462511301,
"num_tokens": 12289939.0,
"step": 2300
},
{
"entropy": 0.6146723322104662,
"epoch": 0.40021223376032744,
"grad_norm": 0.1708984375,
"learning_rate": 0.00013640719863106888,
"loss": 0.6222431182861328,
"mean_token_accuracy": 0.8339255709201098,
"num_tokens": 12344232.0,
"step": 2310
},
{
"entropy": 0.6121346159372478,
"epoch": 0.4019447542527964,
"grad_norm": 0.201171875,
"learning_rate": 0.00013588394358739168,
"loss": 0.6056359291076661,
"mean_token_accuracy": 0.8359162289649248,
"num_tokens": 12395354.0,
"step": 2320
},
{
"entropy": 0.5537781528197229,
"epoch": 0.4036772747452653,
"grad_norm": 0.205078125,
"learning_rate": 0.00013535955840179918,
"loss": 0.5524442195892334,
"mean_token_accuracy": 0.8491223704069852,
"num_tokens": 12443486.0,
"step": 2330
},
{
"entropy": 0.5908654337283223,
"epoch": 0.4054097952377343,
"grad_norm": 0.1748046875,
"learning_rate": 0.0001348340595894683,
"loss": 0.6637831211090088,
"mean_token_accuracy": 0.8352008298039436,
"num_tokens": 12498278.0,
"step": 2340
},
{
"entropy": 0.6369602079503238,
"epoch": 0.40714231573020326,
"grad_norm": 0.2216796875,
"learning_rate": 0.00013430746370064905,
"loss": 0.6277615070343018,
"mean_token_accuracy": 0.830039632320404,
"num_tokens": 12548979.0,
"step": 2350
},
{
"entropy": 0.5778507422655821,
"epoch": 0.4088748362226722,
"grad_norm": 0.248046875,
"learning_rate": 0.00013377978732014297,
"loss": 0.5777788162231445,
"mean_token_accuracy": 0.8472949586808681,
"num_tokens": 12600361.0,
"step": 2360
},
{
"entropy": 0.6153424762189388,
"epoch": 0.41060735671514115,
"grad_norm": 0.177734375,
"learning_rate": 0.00013325104706678117,
"loss": 0.6212099552154541,
"mean_token_accuracy": 0.8323879513889552,
"num_tokens": 12650080.0,
"step": 2370
},
{
"entropy": 0.5499768436653539,
"epoch": 0.4123398772076101,
"grad_norm": 0.205078125,
"learning_rate": 0.0001327212595929006,
"loss": 0.556803035736084,
"mean_token_accuracy": 0.8466630782932043,
"num_tokens": 12707694.0,
"step": 2380
},
{
"entropy": 0.5946451628580689,
"epoch": 0.41407239770007903,
"grad_norm": 0.1787109375,
"learning_rate": 0.00013219044158381988,
"loss": 0.6023283004760742,
"mean_token_accuracy": 0.8404143087565898,
"num_tokens": 12763899.0,
"step": 2390
},
{
"entropy": 0.5769397917203605,
"epoch": 0.415804918192548,
"grad_norm": 0.1728515625,
"learning_rate": 0.00013165860975731364,
"loss": 0.5805276393890381,
"mean_token_accuracy": 0.8394303295761347,
"num_tokens": 12816977.0,
"step": 2400
},
{
"entropy": 0.6263184855692089,
"epoch": 0.41753743868501697,
"grad_norm": 0.201171875,
"learning_rate": 0.00013112578086308603,
"loss": 0.6258736610412597,
"mean_token_accuracy": 0.8292172599583865,
"num_tokens": 12867177.0,
"step": 2410
},
{
"entropy": 0.5767630891874432,
"epoch": 0.4192699591774859,
"grad_norm": 0.21875,
"learning_rate": 0.0001305919716822432,
"loss": 0.5918225765228271,
"mean_token_accuracy": 0.8412780135869979,
"num_tokens": 12921784.0,
"step": 2420
},
{
"entropy": 0.5780319124925881,
"epoch": 0.42100247966995485,
"grad_norm": 0.2060546875,
"learning_rate": 0.00013005719902676484,
"loss": 0.5864857196807861,
"mean_token_accuracy": 0.8374421495944262,
"num_tokens": 12974494.0,
"step": 2430
},
{
"entropy": 0.5848251041024923,
"epoch": 0.42273500016242377,
"grad_norm": 0.1787109375,
"learning_rate": 0.00012952147973897463,
"loss": 0.5625586032867431,
"mean_token_accuracy": 0.8452736441045999,
"num_tokens": 13029741.0,
"step": 2440
},
{
"entropy": 0.5782041396014392,
"epoch": 0.42446752065489274,
"grad_norm": 0.197265625,
"learning_rate": 0.0001289848306910098,
"loss": 0.5688180923461914,
"mean_token_accuracy": 0.842210229113698,
"num_tokens": 13082150.0,
"step": 2450
},
{
"entropy": 0.5863951063714922,
"epoch": 0.4262000411473617,
"grad_norm": 0.177734375,
"learning_rate": 0.00012844726878428992,
"loss": 0.5963150501251221,
"mean_token_accuracy": 0.8403796773403883,
"num_tokens": 13137759.0,
"step": 2460
},
{
"entropy": 0.5558338332921267,
"epoch": 0.4279325616398306,
"grad_norm": 0.21484375,
"learning_rate": 0.00012790881094898427,
"loss": 0.5558866024017334,
"mean_token_accuracy": 0.8459072947502136,
"num_tokens": 13192630.0,
"step": 2470
},
{
"entropy": 0.546316223940812,
"epoch": 0.4296650821322996,
"grad_norm": 0.203125,
"learning_rate": 0.000127369474143479,
"loss": 0.5630002975463867,
"mean_token_accuracy": 0.8511018488556147,
"num_tokens": 13247752.0,
"step": 2480
},
{
"entropy": 0.5771075886674225,
"epoch": 0.43139760262476856,
"grad_norm": 0.1669921875,
"learning_rate": 0.00012682927535384272,
"loss": 0.5783199310302735,
"mean_token_accuracy": 0.8392299171537161,
"num_tokens": 13301263.0,
"step": 2490
},
{
"entropy": 0.6328532771673053,
"epoch": 0.4331301231172375,
"grad_norm": 0.1552734375,
"learning_rate": 0.0001262882315932918,
"loss": 0.6653527736663818,
"mean_token_accuracy": 0.8329028349369765,
"num_tokens": 13355347.0,
"step": 2500
},
{
"entropy": 0.5985511194681749,
"epoch": 0.43486264360970645,
"grad_norm": 0.2421875,
"learning_rate": 0.0001257463599016544,
"loss": 0.6060856342315674,
"mean_token_accuracy": 0.8381591210141778,
"num_tokens": 13410328.0,
"step": 2510
},
{
"entropy": 0.6097901756409556,
"epoch": 0.4365951641021754,
"grad_norm": 0.1689453125,
"learning_rate": 0.00012520367734483376,
"loss": 0.5944780826568603,
"mean_token_accuracy": 0.8347636796534061,
"num_tokens": 13458141.0,
"step": 2520
},
{
"entropy": 0.5965319158509373,
"epoch": 0.43832768459464433,
"grad_norm": 0.162109375,
"learning_rate": 0.00012466020101427092,
"loss": 0.6008960247039795,
"mean_token_accuracy": 0.8366463247686624,
"num_tokens": 13516437.0,
"step": 2530
},
{
"entropy": 0.6449747297912836,
"epoch": 0.4400602050871133,
"grad_norm": 0.27734375,
"learning_rate": 0.0001241159480264062,
"loss": 0.6599147319793701,
"mean_token_accuracy": 0.8267238955944777,
"num_tokens": 13565792.0,
"step": 2540
},
{
"entropy": 0.601561525510624,
"epoch": 0.44179272557958227,
"grad_norm": 0.177734375,
"learning_rate": 0.00012357093552214042,
"loss": 0.6049664974212646,
"mean_token_accuracy": 0.8392731335014105,
"num_tokens": 13622412.0,
"step": 2550
},
{
"entropy": 0.5839989837259054,
"epoch": 0.4435252460720512,
"grad_norm": 0.193359375,
"learning_rate": 0.00012302518066629466,
"loss": 0.5930441379547119,
"mean_token_accuracy": 0.8389767237007618,
"num_tokens": 13676864.0,
"step": 2560
},
{
"entropy": 0.5947200076654553,
"epoch": 0.44525776656452015,
"grad_norm": 0.1943359375,
"learning_rate": 0.0001224787006470701,
"loss": 0.632440710067749,
"mean_token_accuracy": 0.8404598146677017,
"num_tokens": 13739726.0,
"step": 2570
},
{
"entropy": 0.5818848529364914,
"epoch": 0.4469902870569891,
"grad_norm": 0.16796875,
"learning_rate": 0.0001219315126755063,
"loss": 0.5822898387908936,
"mean_token_accuracy": 0.8407908231019974,
"num_tokens": 13793872.0,
"step": 2580
},
{
"entropy": 0.5871871233917773,
"epoch": 0.44872280754945804,
"grad_norm": 0.2275390625,
"learning_rate": 0.00012138363398493946,
"loss": 0.5781790733337402,
"mean_token_accuracy": 0.8415582459419966,
"num_tokens": 13845952.0,
"step": 2590
},
{
"entropy": 0.5868519256589935,
"epoch": 0.450455328041927,
"grad_norm": 0.2138671875,
"learning_rate": 0.00012083508183045946,
"loss": 0.5890952587127686,
"mean_token_accuracy": 0.8406406987458468,
"num_tokens": 13900081.0,
"step": 2600
},
{
"entropy": 0.5717327733058483,
"epoch": 0.4521878485343959,
"grad_norm": 0.1982421875,
"learning_rate": 0.00012028587348836654,
"loss": 0.5796187400817872,
"mean_token_accuracy": 0.8397781111299991,
"num_tokens": 13952949.0,
"step": 2610
},
{
"entropy": 0.582226577727124,
"epoch": 0.4539203690268649,
"grad_norm": 0.1953125,
"learning_rate": 0.00011973602625562711,
"loss": 0.6070287704467774,
"mean_token_accuracy": 0.8392535090446472,
"num_tokens": 14004724.0,
"step": 2620
},
{
"entropy": 0.5673700920306146,
"epoch": 0.45565288951933386,
"grad_norm": 0.2412109375,
"learning_rate": 0.00011918555744932904,
"loss": 0.5730877876281738,
"mean_token_accuracy": 0.8469384342432023,
"num_tokens": 14062688.0,
"step": 2630
},
{
"entropy": 0.5877885912545026,
"epoch": 0.4573854100118028,
"grad_norm": 0.2041015625,
"learning_rate": 0.00011863448440613634,
"loss": 0.5773820877075195,
"mean_token_accuracy": 0.839915756508708,
"num_tokens": 14113953.0,
"step": 2640
},
{
"entropy": 0.5963851167354732,
"epoch": 0.45911793050427174,
"grad_norm": 0.2060546875,
"learning_rate": 0.00011808282448174295,
"loss": 0.5954080104827881,
"mean_token_accuracy": 0.8391872305423022,
"num_tokens": 14165410.0,
"step": 2650
},
{
"entropy": 0.5849010232836008,
"epoch": 0.4608504509967407,
"grad_norm": 0.2177734375,
"learning_rate": 0.00011753059505032635,
"loss": 0.6184982776641845,
"mean_token_accuracy": 0.8388860560953617,
"num_tokens": 14219014.0,
"step": 2660
},
{
"entropy": 0.6050059227272868,
"epoch": 0.4625829714892096,
"grad_norm": 0.19921875,
"learning_rate": 0.00011697781350400025,
"loss": 0.5937928199768067,
"mean_token_accuracy": 0.8371570736169816,
"num_tokens": 14277983.0,
"step": 2670
},
{
"entropy": 0.55124610546045,
"epoch": 0.4643154919816786,
"grad_norm": 0.1728515625,
"learning_rate": 0.00011642449725226685,
"loss": 0.5754414081573487,
"mean_token_accuracy": 0.8441458832472563,
"num_tokens": 14334686.0,
"step": 2680
},
{
"entropy": 0.6277578006032855,
"epoch": 0.46604801247414757,
"grad_norm": 0.2578125,
"learning_rate": 0.00011587066372146861,
"loss": 0.6408638000488281,
"mean_token_accuracy": 0.8318171612918377,
"num_tokens": 14386998.0,
"step": 2690
},
{
"entropy": 0.5673693493008614,
"epoch": 0.4677805329666165,
"grad_norm": 0.1806640625,
"learning_rate": 0.0001153163303542393,
"loss": 0.5812714576721192,
"mean_token_accuracy": 0.8425166368484497,
"num_tokens": 14445548.0,
"step": 2700
},
{
"entropy": 0.613515446241945,
"epoch": 0.46951305345908545,
"grad_norm": 0.166015625,
"learning_rate": 0.00011476151460895477,
"loss": 0.6238789081573486,
"mean_token_accuracy": 0.8347268708050251,
"num_tokens": 14494120.0,
"step": 2710
},
{
"entropy": 0.6357726425863802,
"epoch": 0.4712455739515544,
"grad_norm": 0.1748046875,
"learning_rate": 0.00011420623395918297,
"loss": 0.6014580249786377,
"mean_token_accuracy": 0.8301781140267849,
"num_tokens": 14548742.0,
"step": 2720
},
{
"entropy": 0.5693127868697048,
"epoch": 0.47297809444402333,
"grad_norm": 0.208984375,
"learning_rate": 0.00011365050589313391,
"loss": 0.5637072563171387,
"mean_token_accuracy": 0.8451267022639513,
"num_tokens": 14600515.0,
"step": 2730
},
{
"entropy": 0.5784962127916515,
"epoch": 0.4747106149364923,
"grad_norm": 0.1533203125,
"learning_rate": 0.00011309434791310846,
"loss": 0.5662568092346192,
"mean_token_accuracy": 0.8453169971704483,
"num_tokens": 14652098.0,
"step": 2740
},
{
"entropy": 0.5996901510283351,
"epoch": 0.4764431354289613,
"grad_norm": 0.1669921875,
"learning_rate": 0.00011253777753494752,
"loss": 0.5977088928222656,
"mean_token_accuracy": 0.837460282444954,
"num_tokens": 14705588.0,
"step": 2750
},
{
"entropy": 0.5490922763012349,
"epoch": 0.4781756559214302,
"grad_norm": 0.19921875,
"learning_rate": 0.00011198081228748013,
"loss": 0.5457263946533203,
"mean_token_accuracy": 0.8470884084701538,
"num_tokens": 14753632.0,
"step": 2760
},
{
"entropy": 0.572597084986046,
"epoch": 0.47990817641389916,
"grad_norm": 0.2421875,
"learning_rate": 0.0001114234697119715,
"loss": 0.549776268005371,
"mean_token_accuracy": 0.8426673550158739,
"num_tokens": 14804928.0,
"step": 2770
},
{
"entropy": 0.5902726739645004,
"epoch": 0.48164069690636807,
"grad_norm": 0.1806640625,
"learning_rate": 0.0001108657673615706,
"loss": 0.6166749000549316,
"mean_token_accuracy": 0.8378476161509752,
"num_tokens": 14854574.0,
"step": 2780
},
{
"entropy": 0.5925680194981396,
"epoch": 0.48337321739883704,
"grad_norm": 0.2080078125,
"learning_rate": 0.00011030772280075714,
"loss": 0.5907174587249756,
"mean_token_accuracy": 0.8409414291381836,
"num_tokens": 14906122.0,
"step": 2790
},
{
"entropy": 0.6074271734803915,
"epoch": 0.485105737891306,
"grad_norm": 0.2353515625,
"learning_rate": 0.00010974935360478876,
"loss": 0.6153085708618165,
"mean_token_accuracy": 0.8358694747090339,
"num_tokens": 14959790.0,
"step": 2800
},
{
"entropy": 0.5647475293837487,
"epoch": 0.4868382583837749,
"grad_norm": 0.166015625,
"learning_rate": 0.00010919067735914699,
"loss": 0.5801798820495605,
"mean_token_accuracy": 0.8441315289586783,
"num_tokens": 15015091.0,
"step": 2810
},
{
"entropy": 0.5615489536430687,
"epoch": 0.4885707788762439,
"grad_norm": 0.2080078125,
"learning_rate": 0.00010863171165898398,
"loss": 0.5529567241668701,
"mean_token_accuracy": 0.8446899481117726,
"num_tokens": 15063799.0,
"step": 2820
},
{
"entropy": 0.587787312315777,
"epoch": 0.49030329936871286,
"grad_norm": 0.2001953125,
"learning_rate": 0.00010807247410856783,
"loss": 0.5839251518249512,
"mean_token_accuracy": 0.8386691033840179,
"num_tokens": 15118840.0,
"step": 2830
},
{
"entropy": 0.6014495314564556,
"epoch": 0.4920358198611818,
"grad_norm": 0.212890625,
"learning_rate": 0.00010751298232072855,
"loss": 0.6540067195892334,
"mean_token_accuracy": 0.8377440456300974,
"num_tokens": 15169526.0,
"step": 2840
},
{
"entropy": 0.6273791050072759,
"epoch": 0.49376834035365075,
"grad_norm": 0.2060546875,
"learning_rate": 0.00010695325391630308,
"loss": 0.6305361747741699,
"mean_token_accuracy": 0.8297456104308367,
"num_tokens": 15224473.0,
"step": 2850
},
{
"entropy": 0.59466298725456,
"epoch": 0.4955008608461197,
"grad_norm": 0.201171875,
"learning_rate": 0.00010639330652358058,
"loss": 0.5955989360809326,
"mean_token_accuracy": 0.837109775096178,
"num_tokens": 15281656.0,
"step": 2860
},
{
"entropy": 0.590182079654187,
"epoch": 0.49723338133858863,
"grad_norm": 0.2373046875,
"learning_rate": 0.00010583315777774696,
"loss": 0.6159713745117188,
"mean_token_accuracy": 0.8404981274157762,
"num_tokens": 15333150.0,
"step": 2870
},
{
"entropy": 0.57672467129305,
"epoch": 0.4989659018310576,
"grad_norm": 0.185546875,
"learning_rate": 0.00010527282532032969,
"loss": 0.5914871215820312,
"mean_token_accuracy": 0.8392358284443617,
"num_tokens": 15383289.0,
"step": 2880
},
{
"entropy": 0.5869773568119854,
"epoch": 0.5006984223235266,
"grad_norm": 0.2158203125,
"learning_rate": 0.00010471232679864221,
"loss": 0.6114672660827637,
"mean_token_accuracy": 0.8400188889354467,
"num_tokens": 15438613.0,
"step": 2890
},
{
"entropy": 0.6136800131760538,
"epoch": 0.5024309428159955,
"grad_norm": 0.2099609375,
"learning_rate": 0.00010415167986522785,
"loss": 0.6379248142242432,
"mean_token_accuracy": 0.834352083876729,
"num_tokens": 15490587.0,
"step": 2900
},
{
"entropy": 0.6086361592635512,
"epoch": 0.5041634633084644,
"grad_norm": 0.244140625,
"learning_rate": 0.0001035909021773042,
"loss": 0.6333293437957763,
"mean_token_accuracy": 0.8300730381160975,
"num_tokens": 15548870.0,
"step": 2910
},
{
"entropy": 0.6032880510669202,
"epoch": 0.5058959838009334,
"grad_norm": 0.1884765625,
"learning_rate": 0.00010303001139620689,
"loss": 0.6444151878356934,
"mean_token_accuracy": 0.8312817770987749,
"num_tokens": 15598591.0,
"step": 2920
},
{
"entropy": 0.5855811305809766,
"epoch": 0.5076285042934023,
"grad_norm": 0.263671875,
"learning_rate": 0.0001024690251868333,
"loss": 0.6152175426483154,
"mean_token_accuracy": 0.8414902746677398,
"num_tokens": 15649064.0,
"step": 2930
},
{
"entropy": 0.6164896341506392,
"epoch": 0.5093610247858713,
"grad_norm": 0.1845703125,
"learning_rate": 0.00010190796121708628,
"loss": 0.6313320159912109,
"mean_token_accuracy": 0.8366707745939493,
"num_tokens": 15704366.0,
"step": 2940
},
{
"entropy": 0.5785494175273925,
"epoch": 0.5110935452783403,
"grad_norm": 0.23046875,
"learning_rate": 0.0001013468371573177,
"loss": 0.5688902378082276,
"mean_token_accuracy": 0.8470625583082437,
"num_tokens": 15756519.0,
"step": 2950
},
{
"entropy": 0.5922784093767405,
"epoch": 0.5128260657708092,
"grad_norm": 0.1708984375,
"learning_rate": 0.00010078567067977191,
"loss": 0.6074170589447021,
"mean_token_accuracy": 0.838723149895668,
"num_tokens": 15811567.0,
"step": 2960
},
{
"entropy": 0.5760424341075122,
"epoch": 0.5145585862632781,
"grad_norm": 0.1982421875,
"learning_rate": 0.00010022447945802917,
"loss": 0.5844903945922851,
"mean_token_accuracy": 0.8425237882882357,
"num_tokens": 15864474.0,
"step": 2970
},
{
"entropy": 0.6029307945631445,
"epoch": 0.5162911067557471,
"grad_norm": 0.2109375,
"learning_rate": 9.96632811664491e-05,
"loss": 0.6089130401611328,
"mean_token_accuracy": 0.8375063575804234,
"num_tokens": 15915223.0,
"step": 2980
},
{
"entropy": 0.5315724958200008,
"epoch": 0.518023627248216,
"grad_norm": 0.2109375,
"learning_rate": 9.910209347961389e-05,
"loss": 0.5239943027496338,
"mean_token_accuracy": 0.8512597348541021,
"num_tokens": 15973757.0,
"step": 2990
},
{
"entropy": 0.574950763490051,
"epoch": 0.519756147740685,
"grad_norm": 0.2060546875,
"learning_rate": 9.854093407177184e-05,
"loss": 0.5746850490570068,
"mean_token_accuracy": 0.8381776563823223,
"num_tokens": 16025972.0,
"step": 3000
},
{
"entropy": 0.5852484166156501,
"epoch": 0.521488668233154,
"grad_norm": 0.16796875,
"learning_rate": 9.797982061628055e-05,
"loss": 0.5965889453887939,
"mean_token_accuracy": 0.8383524172008038,
"num_tokens": 16076695.0,
"step": 3010
},
{
"entropy": 0.5634748952230438,
"epoch": 0.5232211887256228,
"grad_norm": 0.2265625,
"learning_rate": 9.741877078505045e-05,
"loss": 0.5513391494750977,
"mean_token_accuracy": 0.8460137024521828,
"num_tokens": 16135215.0,
"step": 3020
},
{
"entropy": 0.5869616455864162,
"epoch": 0.5249537092180918,
"grad_norm": 0.2138671875,
"learning_rate": 9.685780224798805e-05,
"loss": 0.5826962471008301,
"mean_token_accuracy": 0.8386240437626838,
"num_tokens": 16188506.0,
"step": 3030
},
{
"entropy": 0.5738142973743379,
"epoch": 0.5266862297105608,
"grad_norm": 0.2197265625,
"learning_rate": 9.629693267243962e-05,
"loss": 0.5730494499206543,
"mean_token_accuracy": 0.840570829808712,
"num_tokens": 16243964.0,
"step": 3040
},
{
"entropy": 0.5921493870206177,
"epoch": 0.5284187502030298,
"grad_norm": 0.23828125,
"learning_rate": 9.573617972263478e-05,
"loss": 0.6039523124694824,
"mean_token_accuracy": 0.8394287832081317,
"num_tokens": 16299274.0,
"step": 3050
},
{
"entropy": 0.6072209506295622,
"epoch": 0.5301512706954987,
"grad_norm": 0.185546875,
"learning_rate": 9.517556105912995e-05,
"loss": 0.6261641979217529,
"mean_token_accuracy": 0.8376805637031793,
"num_tokens": 16355409.0,
"step": 3060
},
{
"entropy": 0.6185756172519177,
"epoch": 0.5318837911879677,
"grad_norm": 0.255859375,
"learning_rate": 9.461509433825238e-05,
"loss": 0.6353075504302979,
"mean_token_accuracy": 0.8332322388887405,
"num_tokens": 16410386.0,
"step": 3070
},
{
"entropy": 0.6121521357446909,
"epoch": 0.5336163116804366,
"grad_norm": 0.26171875,
"learning_rate": 9.405479721154391e-05,
"loss": 0.6405570983886719,
"mean_token_accuracy": 0.8331318866461516,
"num_tokens": 16464158.0,
"step": 3080
},
{
"entropy": 0.6069775213487446,
"epoch": 0.5353488321729055,
"grad_norm": 0.19140625,
"learning_rate": 9.349468732520529e-05,
"loss": 0.5938554763793945,
"mean_token_accuracy": 0.8324613347649574,
"num_tokens": 16521666.0,
"step": 3090
},
{
"entropy": 0.5699784771772102,
"epoch": 0.5370813526653745,
"grad_norm": 0.228515625,
"learning_rate": 9.293478231953997e-05,
"loss": 0.5687154293060303,
"mean_token_accuracy": 0.8443257499486208,
"num_tokens": 16576188.0,
"step": 3100
},
{
"entropy": 0.5675219805445522,
"epoch": 0.5388138731578435,
"grad_norm": 0.22265625,
"learning_rate": 9.23750998283991e-05,
"loss": 0.5806581020355225,
"mean_token_accuracy": 0.843117181584239,
"num_tokens": 16626551.0,
"step": 3110
},
{
"entropy": 0.5873679893091321,
"epoch": 0.5405463936503124,
"grad_norm": 0.18359375,
"learning_rate": 9.181565747862574e-05,
"loss": 0.6099284172058106,
"mean_token_accuracy": 0.8380186520516872,
"num_tokens": 16679481.0,
"step": 3120
},
{
"entropy": 0.5710663202451542,
"epoch": 0.5422789141427814,
"grad_norm": 0.15625,
"learning_rate": 9.125647288949981e-05,
"loss": 0.5839220523834229,
"mean_token_accuracy": 0.8431031309068203,
"num_tokens": 16732976.0,
"step": 3130
},
{
"entropy": 0.596511066146195,
"epoch": 0.5440114346352503,
"grad_norm": 0.197265625,
"learning_rate": 9.069756367218331e-05,
"loss": 0.6071121692657471,
"mean_token_accuracy": 0.8361073154956102,
"num_tokens": 16789389.0,
"step": 3140
},
{
"entropy": 0.6210895074298606,
"epoch": 0.5457439551277192,
"grad_norm": 0.2021484375,
"learning_rate": 9.013894742916553e-05,
"loss": 0.6283562660217286,
"mean_token_accuracy": 0.8354116972535849,
"num_tokens": 16846677.0,
"step": 3150
},
{
"entropy": 0.596269681211561,
"epoch": 0.5474764756201882,
"grad_norm": 0.2451171875,
"learning_rate": 8.958064175370883e-05,
"loss": 0.5808255195617675,
"mean_token_accuracy": 0.838775647431612,
"num_tokens": 16896654.0,
"step": 3160
},
{
"entropy": 0.5483348882757128,
"epoch": 0.5492089961126572,
"grad_norm": 0.1787109375,
"learning_rate": 8.90226642292942e-05,
"loss": 0.5343601703643799,
"mean_token_accuracy": 0.8485178887844086,
"num_tokens": 16944739.0,
"step": 3170
},
{
"entropy": 0.5849819808034227,
"epoch": 0.5509415166051261,
"grad_norm": 0.2451171875,
"learning_rate": 8.846503242906798e-05,
"loss": 0.624034833908081,
"mean_token_accuracy": 0.8375435929745436,
"num_tokens": 17001792.0,
"step": 3180
},
{
"entropy": 0.5735263123176992,
"epoch": 0.552674037097595,
"grad_norm": 0.240234375,
"learning_rate": 8.790776391528803e-05,
"loss": 0.5884189128875732,
"mean_token_accuracy": 0.8433846581727267,
"num_tokens": 17057122.0,
"step": 3190
},
{
"entropy": 0.5874220591969788,
"epoch": 0.554406557590064,
"grad_norm": 0.189453125,
"learning_rate": 8.73508762387707e-05,
"loss": 0.5811627864837646,
"mean_token_accuracy": 0.840981874614954,
"num_tokens": 17109057.0,
"step": 3200
},
{
"entropy": 0.5672381565906107,
"epoch": 0.5561390780825329,
"grad_norm": 0.26953125,
"learning_rate": 8.679438693833822e-05,
"loss": 0.5794447898864746,
"mean_token_accuracy": 0.8454991206526756,
"num_tokens": 17164048.0,
"step": 3210
},
{
"entropy": 0.571211804356426,
"epoch": 0.5578715985750019,
"grad_norm": 0.28125,
"learning_rate": 8.623831354026608e-05,
"loss": 0.5618424892425538,
"mean_token_accuracy": 0.8462431959807872,
"num_tokens": 17221820.0,
"step": 3220
},
{
"entropy": 0.60764075294137,
"epoch": 0.5596041190674709,
"grad_norm": 0.19921875,
"learning_rate": 8.568267355773137e-05,
"loss": 0.6284051895141601,
"mean_token_accuracy": 0.8340359356254339,
"num_tokens": 17274399.0,
"step": 3230
},
{
"entropy": 0.5799334913026541,
"epoch": 0.5613366395599398,
"grad_norm": 0.2431640625,
"learning_rate": 8.512748449026087e-05,
"loss": 0.5892360210418701,
"mean_token_accuracy": 0.842689898610115,
"num_tokens": 17327372.0,
"step": 3240
},
{
"entropy": 0.5794768249150366,
"epoch": 0.5630691600524087,
"grad_norm": 0.189453125,
"learning_rate": 8.457276382318015e-05,
"loss": 0.5738996505737305,
"mean_token_accuracy": 0.8423306241631507,
"num_tokens": 17383576.0,
"step": 3250
},
{
"entropy": 0.6024962943978608,
"epoch": 0.5648016805448777,
"grad_norm": 0.25,
"learning_rate": 8.401852902706285e-05,
"loss": 0.5932654857635498,
"mean_token_accuracy": 0.836880574375391,
"num_tokens": 17436218.0,
"step": 3260
},
{
"entropy": 0.5578272269805893,
"epoch": 0.5665342010373466,
"grad_norm": 0.177734375,
"learning_rate": 8.346479755718028e-05,
"loss": 0.5810702323913575,
"mean_token_accuracy": 0.8456843707710504,
"num_tokens": 17493828.0,
"step": 3270
},
{
"entropy": 0.5836522807134316,
"epoch": 0.5682667215298156,
"grad_norm": 0.2041015625,
"learning_rate": 8.29115868529519e-05,
"loss": 0.5958133220672608,
"mean_token_accuracy": 0.8417525358498097,
"num_tokens": 17546507.0,
"step": 3280
},
{
"entropy": 0.582007565535605,
"epoch": 0.5699992420222846,
"grad_norm": 0.19921875,
"learning_rate": 8.235891433739607e-05,
"loss": 0.5615264892578125,
"mean_token_accuracy": 0.8410556487739086,
"num_tokens": 17599245.0,
"step": 3290
},
{
"entropy": 0.5506704148836434,
"epoch": 0.5717317625147535,
"grad_norm": 0.22265625,
"learning_rate": 8.18067974165811e-05,
"loss": 0.5327036380767822,
"mean_token_accuracy": 0.8516118418425321,
"num_tokens": 17644967.0,
"step": 3300
},
{
"entropy": 0.5811622153501957,
"epoch": 0.5734642830072224,
"grad_norm": 0.29296875,
"learning_rate": 8.125525347907725e-05,
"loss": 0.6177726268768311,
"mean_token_accuracy": 0.8396083325147629,
"num_tokens": 17700648.0,
"step": 3310
},
{
"entropy": 0.5715690411627292,
"epoch": 0.5751968034996914,
"grad_norm": 0.2080078125,
"learning_rate": 8.070429989540903e-05,
"loss": 0.6089767456054688,
"mean_token_accuracy": 0.8419048462063075,
"num_tokens": 17759453.0,
"step": 3320
},
{
"entropy": 0.6150133638642729,
"epoch": 0.5769293239921603,
"grad_norm": 0.2392578125,
"learning_rate": 8.015395401750816e-05,
"loss": 0.6307916641235352,
"mean_token_accuracy": 0.8332836613059044,
"num_tokens": 17815319.0,
"step": 3330
},
{
"entropy": 0.6224826156627387,
"epoch": 0.5786618444846293,
"grad_norm": 0.24609375,
"learning_rate": 7.960423317816707e-05,
"loss": 0.6409733772277832,
"mean_token_accuracy": 0.8375802997499704,
"num_tokens": 17864939.0,
"step": 3340
},
{
"entropy": 0.588920985115692,
"epoch": 0.5803943649770983,
"grad_norm": 0.2265625,
"learning_rate": 7.905515469049287e-05,
"loss": 0.5952839374542236,
"mean_token_accuracy": 0.8417891424149275,
"num_tokens": 17918216.0,
"step": 3350
},
{
"entropy": 0.5630837785080075,
"epoch": 0.5821268854695671,
"grad_norm": 0.185546875,
"learning_rate": 7.850673584736238e-05,
"loss": 0.5541327953338623,
"mean_token_accuracy": 0.8466249253600836,
"num_tokens": 17975742.0,
"step": 3360
},
{
"entropy": 0.575827946467325,
"epoch": 0.5838594059620361,
"grad_norm": 0.2041015625,
"learning_rate": 7.795899392087727e-05,
"loss": 0.6097724914550782,
"mean_token_accuracy": 0.8444040916860104,
"num_tokens": 18029585.0,
"step": 3370
},
{
"entropy": 0.5849282233975828,
"epoch": 0.5855919264545051,
"grad_norm": 0.1884765625,
"learning_rate": 7.74119461618201e-05,
"loss": 0.5895652294158935,
"mean_token_accuracy": 0.8412786796689034,
"num_tokens": 18077047.0,
"step": 3380
},
{
"entropy": 0.589809303288348,
"epoch": 0.587324446946974,
"grad_norm": 0.2109375,
"learning_rate": 7.686560979911115e-05,
"loss": 0.6017866134643555,
"mean_token_accuracy": 0.841454528272152,
"num_tokens": 18131882.0,
"step": 3390
},
{
"entropy": 0.5898898280225694,
"epoch": 0.589056967439443,
"grad_norm": 0.22265625,
"learning_rate": 7.632000203926565e-05,
"loss": 0.5839109420776367,
"mean_token_accuracy": 0.8408774256706237,
"num_tokens": 18187052.0,
"step": 3400
},
{
"entropy": 0.59212601990439,
"epoch": 0.590789487931912,
"grad_norm": 0.1611328125,
"learning_rate": 7.577514006585209e-05,
"loss": 0.6250973224639893,
"mean_token_accuracy": 0.8377660803496838,
"num_tokens": 18239107.0,
"step": 3410
},
{
"entropy": 0.5656685329508037,
"epoch": 0.5925220084243809,
"grad_norm": 0.2001953125,
"learning_rate": 7.523104103895065e-05,
"loss": 0.5862621307373047,
"mean_token_accuracy": 0.8441399410367012,
"num_tokens": 18290779.0,
"step": 3420
},
{
"entropy": 0.5759195055346936,
"epoch": 0.5942545289168498,
"grad_norm": 0.251953125,
"learning_rate": 7.468772209461323e-05,
"loss": 0.5872469425201416,
"mean_token_accuracy": 0.8414444755762815,
"num_tokens": 18341930.0,
"step": 3430
},
{
"entropy": 0.5839247035328299,
"epoch": 0.5959870494093188,
"grad_norm": 0.283203125,
"learning_rate": 7.414520034432344e-05,
"loss": 0.5958654880523682,
"mean_token_accuracy": 0.8407564666122198,
"num_tokens": 18394611.0,
"step": 3440
},
{
"entropy": 0.5786849300027825,
"epoch": 0.5977195699017878,
"grad_norm": 0.255859375,
"learning_rate": 7.360349287445774e-05,
"loss": 0.5799434661865235,
"mean_token_accuracy": 0.8445678118616342,
"num_tokens": 18450041.0,
"step": 3450
},
{
"entropy": 0.5935896479059011,
"epoch": 0.5994520903942567,
"grad_norm": 0.21484375,
"learning_rate": 7.306261674574733e-05,
"loss": 0.5947081565856933,
"mean_token_accuracy": 0.8432171389460563,
"num_tokens": 18507564.0,
"step": 3460
},
{
"entropy": 0.5749802350997925,
"epoch": 0.6011846108867256,
"grad_norm": 0.26171875,
"learning_rate": 7.252258899274095e-05,
"loss": 0.5716835498809815,
"mean_token_accuracy": 0.8433140508830548,
"num_tokens": 18559199.0,
"step": 3470
},
{
"entropy": 0.54188243271783,
"epoch": 0.6029171313791946,
"grad_norm": 0.150390625,
"learning_rate": 7.198342662326827e-05,
"loss": 0.5425021171569824,
"mean_token_accuracy": 0.8488159842789174,
"num_tokens": 18609440.0,
"step": 3480
},
{
"entropy": 0.5910465456545353,
"epoch": 0.6046496518716635,
"grad_norm": 0.1845703125,
"learning_rate": 7.144514661790413e-05,
"loss": 0.6077436447143555,
"mean_token_accuracy": 0.8387968797236681,
"num_tokens": 18668681.0,
"step": 3490
},
{
"entropy": 0.601060884213075,
"epoch": 0.6063821723641325,
"grad_norm": 0.1904296875,
"learning_rate": 7.090776592943402e-05,
"loss": 0.604709243774414,
"mean_token_accuracy": 0.8362816657871008,
"num_tokens": 18723477.0,
"step": 3500
},
{
"entropy": 0.5889260085299611,
"epoch": 0.6081146928566015,
"grad_norm": 0.248046875,
"learning_rate": 7.037130148231998e-05,
"loss": 0.6148191452026367,
"mean_token_accuracy": 0.8380883693695068,
"num_tokens": 18781011.0,
"step": 3510
},
{
"entropy": 0.5905653207097202,
"epoch": 0.6098472133490704,
"grad_norm": 0.1884765625,
"learning_rate": 6.983577017216754e-05,
"loss": 0.5685397624969483,
"mean_token_accuracy": 0.8412429638206959,
"num_tokens": 18836362.0,
"step": 3520
},
{
"entropy": 0.561858502868563,
"epoch": 0.6115797338415393,
"grad_norm": 0.197265625,
"learning_rate": 6.930118886519374e-05,
"loss": 0.5529529094696045,
"mean_token_accuracy": 0.8480452511459589,
"num_tokens": 18889944.0,
"step": 3530
},
{
"entropy": 0.5512642343412153,
"epoch": 0.6133122543340083,
"grad_norm": 0.212890625,
"learning_rate": 6.876757439769593e-05,
"loss": 0.5571891784667968,
"mean_token_accuracy": 0.850096445158124,
"num_tokens": 18944063.0,
"step": 3540
},
{
"entropy": 0.5728070291690528,
"epoch": 0.6150447748264772,
"grad_norm": 0.208984375,
"learning_rate": 6.823494357552136e-05,
"loss": 0.5640948295593262,
"mean_token_accuracy": 0.8431723900139332,
"num_tokens": 18991394.0,
"step": 3550
},
{
"entropy": 0.5761209703050554,
"epoch": 0.6167772953189462,
"grad_norm": 0.17578125,
"learning_rate": 6.770331317353805e-05,
"loss": 0.5933984279632568,
"mean_token_accuracy": 0.8404323156923056,
"num_tokens": 19051491.0,
"step": 3560
},
{
"entropy": 0.5795182818546891,
"epoch": 0.6185098158114152,
"grad_norm": 0.1884765625,
"learning_rate": 6.717269993510642e-05,
"loss": 0.5945269107818604,
"mean_token_accuracy": 0.8381262317299842,
"num_tokens": 19103454.0,
"step": 3570
},
{
"entropy": 0.586546707386151,
"epoch": 0.6202423363038841,
"grad_norm": 0.1865234375,
"learning_rate": 6.664312057155199e-05,
"loss": 0.6067633628845215,
"mean_token_accuracy": 0.8356157563626766,
"num_tokens": 19155618.0,
"step": 3580
},
{
"entropy": 0.5642004692927003,
"epoch": 0.621974856796353,
"grad_norm": 0.20703125,
"learning_rate": 6.611459176163898e-05,
"loss": 0.570903205871582,
"mean_token_accuracy": 0.8450221214443445,
"num_tokens": 19207279.0,
"step": 3590
},
{
"entropy": 0.5884431241080165,
"epoch": 0.623707377288822,
"grad_norm": 0.185546875,
"learning_rate": 6.558713015104518e-05,
"loss": 0.5947638988494873,
"mean_token_accuracy": 0.839688852056861,
"num_tokens": 19260880.0,
"step": 3600
},
{
"entropy": 0.5753527913009748,
"epoch": 0.6254398977812909,
"grad_norm": 0.208984375,
"learning_rate": 6.50607523518376e-05,
"loss": 0.5739696979522705,
"mean_token_accuracy": 0.843867740407586,
"num_tokens": 19314460.0,
"step": 3610
},
{
"entropy": 0.6017448433674872,
"epoch": 0.6271724182737599,
"grad_norm": 0.21484375,
"learning_rate": 6.453547494194929e-05,
"loss": 0.6191208839416504,
"mean_token_accuracy": 0.8382684826850891,
"num_tokens": 19368549.0,
"step": 3620
},
{
"entropy": 0.5728473928757012,
"epoch": 0.6289049387662289,
"grad_norm": 0.212890625,
"learning_rate": 6.401131446465718e-05,
"loss": 0.5917435646057129,
"mean_token_accuracy": 0.8433002319186926,
"num_tokens": 19424310.0,
"step": 3630
},
{
"entropy": 0.6017072153743357,
"epoch": 0.6306374592586977,
"grad_norm": 0.1923828125,
"learning_rate": 6.348828742806121e-05,
"loss": 0.6305885791778565,
"mean_token_accuracy": 0.8348235942423343,
"num_tokens": 19475276.0,
"step": 3640
},
{
"entropy": 0.5752246322226711,
"epoch": 0.6323699797511667,
"grad_norm": 0.25390625,
"learning_rate": 6.296641030456431e-05,
"loss": 0.5686737060546875,
"mean_token_accuracy": 0.8426034320145845,
"num_tokens": 19527832.0,
"step": 3650
},
{
"entropy": 0.5501401219982653,
"epoch": 0.6341025002436357,
"grad_norm": 0.244140625,
"learning_rate": 6.244569953035355e-05,
"loss": 0.5381704807281494,
"mean_token_accuracy": 0.8496629562228918,
"num_tokens": 19578680.0,
"step": 3660
},
{
"entropy": 0.5852787056937814,
"epoch": 0.6358350207361047,
"grad_norm": 0.2265625,
"learning_rate": 6.19261715048827e-05,
"loss": 0.5736754417419434,
"mean_token_accuracy": 0.8424856297671794,
"num_tokens": 19631489.0,
"step": 3670
},
{
"entropy": 0.5958160690963268,
"epoch": 0.6375675412285736,
"grad_norm": 0.255859375,
"learning_rate": 6.140784259035552e-05,
"loss": 0.6208570957183838,
"mean_token_accuracy": 0.8383866585791111,
"num_tokens": 19684521.0,
"step": 3680
},
{
"entropy": 0.5951701735146344,
"epoch": 0.6393000617210426,
"grad_norm": 0.203125,
"learning_rate": 6.089072911121061e-05,
"loss": 0.6026985168457031,
"mean_token_accuracy": 0.8411695055663586,
"num_tokens": 19740764.0,
"step": 3690
},
{
"entropy": 0.575906784972176,
"epoch": 0.6410325822135114,
"grad_norm": 0.3125,
"learning_rate": 6.037484735360711e-05,
"loss": 0.5890356063842773,
"mean_token_accuracy": 0.842427759245038,
"num_tokens": 19793481.0,
"step": 3700
},
{
"entropy": 0.5695828476920723,
"epoch": 0.6427651027059804,
"grad_norm": 0.1943359375,
"learning_rate": 5.9860213564911916e-05,
"loss": 0.5620457649230957,
"mean_token_accuracy": 0.8452866446226835,
"num_tokens": 19844497.0,
"step": 3710
},
{
"entropy": 0.5581729131285101,
"epoch": 0.6444976231984494,
"grad_norm": 0.19140625,
"learning_rate": 5.934684395318806e-05,
"loss": 0.5511328697204589,
"mean_token_accuracy": 0.8449296887964011,
"num_tokens": 19894794.0,
"step": 3720
},
{
"entropy": 0.5855876510962844,
"epoch": 0.6462301436909184,
"grad_norm": 0.2041015625,
"learning_rate": 5.8834754686683866e-05,
"loss": 0.5966204166412353,
"mean_token_accuracy": 0.8407878663390875,
"num_tokens": 19947818.0,
"step": 3730
},
{
"entropy": 0.5957442070823162,
"epoch": 0.6479626641833873,
"grad_norm": 0.1826171875,
"learning_rate": 5.832396189332423e-05,
"loss": 0.60280442237854,
"mean_token_accuracy": 0.8375787112861872,
"num_tokens": 20003002.0,
"step": 3740
},
{
"entropy": 0.6144319356419146,
"epoch": 0.6496951846758563,
"grad_norm": 0.326171875,
"learning_rate": 5.7814481660202424e-05,
"loss": 0.611343240737915,
"mean_token_accuracy": 0.8361466400325298,
"num_tokens": 20053817.0,
"step": 3750
},
{
"entropy": 0.5885245742741972,
"epoch": 0.6514277051683252,
"grad_norm": 0.30859375,
"learning_rate": 5.7306330033073376e-05,
"loss": 0.5991326808929444,
"mean_token_accuracy": 0.8377312365919352,
"num_tokens": 20106764.0,
"step": 3760
},
{
"entropy": 0.5618473440874368,
"epoch": 0.6531602256607941,
"grad_norm": 0.255859375,
"learning_rate": 5.679952301584844e-05,
"loss": 0.5703360080718994,
"mean_token_accuracy": 0.8465285055339337,
"num_tokens": 20159017.0,
"step": 3770
},
{
"entropy": 0.6042450641281902,
"epoch": 0.6548927461532631,
"grad_norm": 0.205078125,
"learning_rate": 5.629407657009143e-05,
"loss": 0.5915566444396972,
"mean_token_accuracy": 0.8349285993725062,
"num_tokens": 20215650.0,
"step": 3780
},
{
"entropy": 0.571340271178633,
"epoch": 0.6566252666457321,
"grad_norm": 0.1689453125,
"learning_rate": 5.579000661451573e-05,
"loss": 0.5710691928863525,
"mean_token_accuracy": 0.8451083436608314,
"num_tokens": 20276446.0,
"step": 3790
},
{
"entropy": 0.5754610357806087,
"epoch": 0.658357787138201,
"grad_norm": 0.201171875,
"learning_rate": 5.528732902448305e-05,
"loss": 0.5327680110931396,
"mean_token_accuracy": 0.844481249153614,
"num_tokens": 20328728.0,
"step": 3800
},
{
"entropy": 0.6063968134578317,
"epoch": 0.6600903076306699,
"grad_norm": 0.1748046875,
"learning_rate": 5.478605963150347e-05,
"loss": 0.6289023876190185,
"mean_token_accuracy": 0.8358895625919104,
"num_tokens": 20382682.0,
"step": 3810
},
{
"entropy": 0.5941935436567292,
"epoch": 0.6618228281231389,
"grad_norm": 0.1611328125,
"learning_rate": 5.4286214222736875e-05,
"loss": 0.5898853778839112,
"mean_token_accuracy": 0.8419016167521477,
"num_tokens": 20435410.0,
"step": 3820
},
{
"entropy": 0.579904412291944,
"epoch": 0.6635553486156078,
"grad_norm": 0.1787109375,
"learning_rate": 5.3787808540495534e-05,
"loss": 0.5740793704986572,
"mean_token_accuracy": 0.8450499411672354,
"num_tokens": 20488002.0,
"step": 3830
},
{
"entropy": 0.5939912447705865,
"epoch": 0.6652878691080768,
"grad_norm": 0.1923828125,
"learning_rate": 5.329085828174847e-05,
"loss": 0.5808038234710693,
"mean_token_accuracy": 0.8370831325650215,
"num_tokens": 20537293.0,
"step": 3840
},
{
"entropy": 0.5658927114214748,
"epoch": 0.6670203896005458,
"grad_norm": 0.251953125,
"learning_rate": 5.27953790976272e-05,
"loss": 0.5806662559509277,
"mean_token_accuracy": 0.8480444595217704,
"num_tokens": 20592677.0,
"step": 3850
},
{
"entropy": 0.5773649536306038,
"epoch": 0.6687529100930147,
"grad_norm": 0.1845703125,
"learning_rate": 5.230138659293253e-05,
"loss": 0.618853759765625,
"mean_token_accuracy": 0.8424112224951387,
"num_tokens": 20645296.0,
"step": 3860
},
{
"entropy": 0.5486746313516051,
"epoch": 0.6704854305854836,
"grad_norm": 0.1708984375,
"learning_rate": 5.180889632564331e-05,
"loss": 0.5274429321289062,
"mean_token_accuracy": 0.8531730443239212,
"num_tokens": 20696642.0,
"step": 3870
},
{
"entropy": 0.572584178717807,
"epoch": 0.6722179510779526,
"grad_norm": 0.208984375,
"learning_rate": 5.131792380642639e-05,
"loss": 0.5815223693847656,
"mean_token_accuracy": 0.8469138272106648,
"num_tokens": 20748366.0,
"step": 3880
},
{
"entropy": 0.5805146366590634,
"epoch": 0.6739504715704215,
"grad_norm": 0.2001953125,
"learning_rate": 5.082848449814815e-05,
"loss": 0.6078445434570312,
"mean_token_accuracy": 0.8376872267574071,
"num_tokens": 20799591.0,
"step": 3890
},
{
"entropy": 0.5745012188563123,
"epoch": 0.6756829920628905,
"grad_norm": 0.2265625,
"learning_rate": 5.0340593815387394e-05,
"loss": 0.578024435043335,
"mean_token_accuracy": 0.8426983803510666,
"num_tokens": 20854587.0,
"step": 3900
},
{
"entropy": 0.5941596085438505,
"epoch": 0.6774155125553595,
"grad_norm": 0.2060546875,
"learning_rate": 4.985426712394994e-05,
"loss": 0.6132090568542481,
"mean_token_accuracy": 0.8365705825388432,
"num_tokens": 20905558.0,
"step": 3910
},
{
"entropy": 0.558493199152872,
"epoch": 0.6791480330478284,
"grad_norm": 0.2177734375,
"learning_rate": 4.9369519740384805e-05,
"loss": 0.5631945610046387,
"mean_token_accuracy": 0.8453404325991869,
"num_tokens": 20961477.0,
"step": 3920
},
{
"entropy": 0.6204601846635341,
"epoch": 0.6808805535402973,
"grad_norm": 0.2255859375,
"learning_rate": 4.8886366931501614e-05,
"loss": 0.6358794689178466,
"mean_token_accuracy": 0.8305168882012367,
"num_tokens": 21009478.0,
"step": 3930
},
{
"entropy": 0.5932569999014958,
"epoch": 0.6826130740327663,
"grad_norm": 0.314453125,
"learning_rate": 4.840482391388987e-05,
"loss": 0.5845652103424073,
"mean_token_accuracy": 0.8384004920721054,
"num_tokens": 21062772.0,
"step": 3940
},
{
"entropy": 0.5521581314504147,
"epoch": 0.6843455945252352,
"grad_norm": 0.21875,
"learning_rate": 4.792490585343983e-05,
"loss": 0.5398716926574707,
"mean_token_accuracy": 0.8492032889276743,
"num_tokens": 21114869.0,
"step": 3950
},
{
"entropy": 0.583714248938486,
"epoch": 0.6860781150177042,
"grad_norm": 0.1728515625,
"learning_rate": 4.744662786486471e-05,
"loss": 0.5952413558959961,
"mean_token_accuracy": 0.8407733146101236,
"num_tokens": 21172791.0,
"step": 3960
},
{
"entropy": 0.5898357476107776,
"epoch": 0.6878106355101732,
"grad_norm": 0.1923828125,
"learning_rate": 4.697000501122467e-05,
"loss": 0.5954113006591797,
"mean_token_accuracy": 0.8401012167334556,
"num_tokens": 21228419.0,
"step": 3970
},
{
"entropy": 0.548321096599102,
"epoch": 0.689543156002642,
"grad_norm": 0.193359375,
"learning_rate": 4.649505230345244e-05,
"loss": 0.5236709117889404,
"mean_token_accuracy": 0.8472159929573536,
"num_tokens": 21281778.0,
"step": 3980
},
{
"entropy": 0.5716894276440143,
"epoch": 0.691275676495111,
"grad_norm": 0.2119140625,
"learning_rate": 4.602178469988064e-05,
"loss": 0.570991039276123,
"mean_token_accuracy": 0.8435146156698465,
"num_tokens": 21335385.0,
"step": 3990
},
{
"entropy": 0.5994025730295107,
"epoch": 0.69300819698758,
"grad_norm": 0.1884765625,
"learning_rate": 4.5550217105770674e-05,
"loss": 0.5998933792114258,
"mean_token_accuracy": 0.8382619321346283,
"num_tokens": 21393082.0,
"step": 4000
},
{
"entropy": 0.5763973373454064,
"epoch": 0.694740717480049,
"grad_norm": 0.2060546875,
"learning_rate": 4.5080364372842976e-05,
"loss": 0.5872276306152344,
"mean_token_accuracy": 0.8479617930948734,
"num_tokens": 21445710.0,
"step": 4010
},
{
"entropy": 0.6155249847099185,
"epoch": 0.6964732379725179,
"grad_norm": 0.19921875,
"learning_rate": 4.4612241298809756e-05,
"loss": 0.63254714012146,
"mean_token_accuracy": 0.8309660295024515,
"num_tokens": 21499068.0,
"step": 4020
},
{
"entropy": 0.5553503627888858,
"epoch": 0.6982057584649869,
"grad_norm": 0.251953125,
"learning_rate": 4.4145862626908684e-05,
"loss": 0.5443556308746338,
"mean_token_accuracy": 0.8461846563965082,
"num_tokens": 21549682.0,
"step": 4030
},
{
"entropy": 0.53650197731331,
"epoch": 0.6999382789574558,
"grad_norm": 0.2109375,
"learning_rate": 4.3681243045438515e-05,
"loss": 0.5042569160461425,
"mean_token_accuracy": 0.8553239502012729,
"num_tokens": 21602773.0,
"step": 4040
},
{
"entropy": 0.5737016116734595,
"epoch": 0.7016707994499247,
"grad_norm": 0.1943359375,
"learning_rate": 4.32183971872966e-05,
"loss": 0.5885915279388427,
"mean_token_accuracy": 0.8434899553656579,
"num_tokens": 21652306.0,
"step": 4050
},
{
"entropy": 0.5552554502850399,
"epoch": 0.7034033199423937,
"grad_norm": 0.2412109375,
"learning_rate": 4.2757339629518035e-05,
"loss": 0.5580289840698243,
"mean_token_accuracy": 0.8487752258777619,
"num_tokens": 21703372.0,
"step": 4060
},
{
"entropy": 0.5768985984381289,
"epoch": 0.7051358404348627,
"grad_norm": 0.251953125,
"learning_rate": 4.229808489281657e-05,
"loss": 0.6017580032348633,
"mean_token_accuracy": 0.8439400654286147,
"num_tokens": 21755926.0,
"step": 4070
},
{
"entropy": 0.6120095189660788,
"epoch": 0.7068683609273316,
"grad_norm": 0.2216796875,
"learning_rate": 4.184064744112718e-05,
"loss": 0.6320703506469727,
"mean_token_accuracy": 0.8355493500828743,
"num_tokens": 21812681.0,
"step": 4080
},
{
"entropy": 0.5636088127736002,
"epoch": 0.7086008814198006,
"grad_norm": 0.2119140625,
"learning_rate": 4.1385041681150594e-05,
"loss": 0.5749011993408203,
"mean_token_accuracy": 0.8419094953685999,
"num_tokens": 21867716.0,
"step": 4090
},
{
"entropy": 0.5694676558021456,
"epoch": 0.7103334019122695,
"grad_norm": 0.2275390625,
"learning_rate": 4.09312819618997e-05,
"loss": 0.5456663608551026,
"mean_token_accuracy": 0.8421003673225641,
"num_tokens": 21918203.0,
"step": 4100
},
{
"entropy": 0.5702879796735942,
"epoch": 0.7120659224047384,
"grad_norm": 0.251953125,
"learning_rate": 4.047938257424739e-05,
"loss": 0.5769749641418457,
"mean_token_accuracy": 0.840731156617403,
"num_tokens": 21969601.0,
"step": 4110
},
{
"entropy": 0.5680196524597705,
"epoch": 0.7137984428972074,
"grad_norm": 0.22265625,
"learning_rate": 4.00293577504766e-05,
"loss": 0.5617639064788819,
"mean_token_accuracy": 0.8453905589878559,
"num_tokens": 22023823.0,
"step": 4120
},
{
"entropy": 0.5798379408195615,
"epoch": 0.7155309633896764,
"grad_norm": 0.2119140625,
"learning_rate": 3.9581221663832166e-05,
"loss": 0.6011070728302002,
"mean_token_accuracy": 0.8384223252534866,
"num_tokens": 22076897.0,
"step": 4130
},
{
"entropy": 0.5674789244541898,
"epoch": 0.7172634838821453,
"grad_norm": 0.244140625,
"learning_rate": 3.913498842807433e-05,
"loss": 0.5677319049835206,
"mean_token_accuracy": 0.8429323259741068,
"num_tokens": 22132468.0,
"step": 4140
},
{
"entropy": 0.5730633283033967,
"epoch": 0.7189960043746142,
"grad_norm": 0.1953125,
"learning_rate": 3.8690672097034186e-05,
"loss": 0.59276442527771,
"mean_token_accuracy": 0.8416654709726572,
"num_tokens": 22186702.0,
"step": 4150
},
{
"entropy": 0.6094420235138387,
"epoch": 0.7207285248670832,
"grad_norm": 0.251953125,
"learning_rate": 3.824828666417114e-05,
"loss": 0.6083714008331299,
"mean_token_accuracy": 0.8370202928781509,
"num_tokens": 22239147.0,
"step": 4160
},
{
"entropy": 0.5858336496166885,
"epoch": 0.7224610453595521,
"grad_norm": 0.267578125,
"learning_rate": 3.780784606213229e-05,
"loss": 0.6024020671844482,
"mean_token_accuracy": 0.8398869067430497,
"num_tokens": 22291494.0,
"step": 4170
},
{
"entropy": 0.5746008921880275,
"epoch": 0.7241935658520211,
"grad_norm": 0.193359375,
"learning_rate": 3.7369364162313525e-05,
"loss": 0.5637946605682373,
"mean_token_accuracy": 0.8452662628144025,
"num_tokens": 22347209.0,
"step": 4180
},
{
"entropy": 0.5705623811576516,
"epoch": 0.7259260863444901,
"grad_norm": 0.240234375,
"learning_rate": 3.693285477442245e-05,
"loss": 0.558026123046875,
"mean_token_accuracy": 0.8441093850880861,
"num_tokens": 22402861.0,
"step": 4190
},
{
"entropy": 0.6150487074628472,
"epoch": 0.727658606836959,
"grad_norm": 0.2412109375,
"learning_rate": 3.6498331646043915e-05,
"loss": 0.6077510833740234,
"mean_token_accuracy": 0.8339765869081021,
"num_tokens": 22459561.0,
"step": 4200
},
{
"entropy": 0.5854987013153732,
"epoch": 0.7293911273294279,
"grad_norm": 0.154296875,
"learning_rate": 3.606580846220671e-05,
"loss": 0.5959908485412597,
"mean_token_accuracy": 0.8377656571567058,
"num_tokens": 22513317.0,
"step": 4210
},
{
"entropy": 0.5632983278017492,
"epoch": 0.7311236478218969,
"grad_norm": 0.33984375,
"learning_rate": 3.563529884495259e-05,
"loss": 0.5580694675445557,
"mean_token_accuracy": 0.8474770098924637,
"num_tokens": 22567784.0,
"step": 4220
},
{
"entropy": 0.5178743036929518,
"epoch": 0.7328561683143658,
"grad_norm": 0.1845703125,
"learning_rate": 3.5206816352907347e-05,
"loss": 0.5083220958709717,
"mean_token_accuracy": 0.8617038175463676,
"num_tokens": 22620493.0,
"step": 4230
},
{
"entropy": 0.5757345825433731,
"epoch": 0.7345886888068348,
"grad_norm": 0.2138671875,
"learning_rate": 3.478037448085377e-05,
"loss": 0.5746479034423828,
"mean_token_accuracy": 0.8421594180166722,
"num_tokens": 22667711.0,
"step": 4240
},
{
"entropy": 0.5781311514321714,
"epoch": 0.7363212092993038,
"grad_norm": 0.169921875,
"learning_rate": 3.435598665930672e-05,
"loss": 0.5761359214782715,
"mean_token_accuracy": 0.8447645794600248,
"num_tokens": 22715914.0,
"step": 4250
},
{
"entropy": 0.555015804246068,
"epoch": 0.7380537297917726,
"grad_norm": 0.220703125,
"learning_rate": 3.393366625408979e-05,
"loss": 0.5434780597686768,
"mean_token_accuracy": 0.8475862570106983,
"num_tokens": 22772021.0,
"step": 4260
},
{
"entropy": 0.5712562045897357,
"epoch": 0.7397862502842416,
"grad_norm": 0.177734375,
"learning_rate": 3.351342656591485e-05,
"loss": 0.5471843719482422,
"mean_token_accuracy": 0.8448881905525922,
"num_tokens": 22828411.0,
"step": 4270
},
{
"entropy": 0.5824979926692322,
"epoch": 0.7415187707767106,
"grad_norm": 0.22265625,
"learning_rate": 3.309528082996287e-05,
"loss": 0.5932351589202881,
"mean_token_accuracy": 0.8430131062865257,
"num_tokens": 22878451.0,
"step": 4280
},
{
"entropy": 0.5524549225345254,
"epoch": 0.7432512912691795,
"grad_norm": 0.27734375,
"learning_rate": 3.267924221546707e-05,
"loss": 0.5674274444580079,
"mean_token_accuracy": 0.8445836905390024,
"num_tokens": 22926711.0,
"step": 4290
},
{
"entropy": 0.5855007180478424,
"epoch": 0.7449838117616485,
"grad_norm": 0.248046875,
"learning_rate": 3.226532382529819e-05,
"loss": 0.5742456436157226,
"mean_token_accuracy": 0.8387997157871723,
"num_tokens": 22978219.0,
"step": 4300
},
{
"entropy": 0.5859048544429243,
"epoch": 0.7467163322541175,
"grad_norm": 0.263671875,
"learning_rate": 3.185353869555197e-05,
"loss": 0.6278098106384278,
"mean_token_accuracy": 0.8396085597574711,
"num_tokens": 23032320.0,
"step": 4310
},
{
"entropy": 0.5829876080388203,
"epoch": 0.7484488527465863,
"grad_norm": 0.240234375,
"learning_rate": 3.1443899795138453e-05,
"loss": 0.5955277919769287,
"mean_token_accuracy": 0.8417782884091138,
"num_tokens": 23085064.0,
"step": 4320
},
{
"entropy": 0.578710913611576,
"epoch": 0.7501813732390553,
"grad_norm": 0.1806640625,
"learning_rate": 3.103642002537349e-05,
"loss": 0.5915605545043945,
"mean_token_accuracy": 0.8424369305372238,
"num_tokens": 23136211.0,
"step": 4330
},
{
"entropy": 0.5652547443984076,
"epoch": 0.7519138937315243,
"grad_norm": 0.201171875,
"learning_rate": 3.06311122195725e-05,
"loss": 0.5689744472503662,
"mean_token_accuracy": 0.8439708940684796,
"num_tokens": 23193103.0,
"step": 4340
},
{
"entropy": 0.5435447356197983,
"epoch": 0.7536464142239933,
"grad_norm": 0.1630859375,
"learning_rate": 3.0227989142646328e-05,
"loss": 0.5281671524047852,
"mean_token_accuracy": 0.8518698431551457,
"num_tokens": 23247160.0,
"step": 4350
},
{
"entropy": 0.5385241145500913,
"epoch": 0.7553789347164622,
"grad_norm": 0.19140625,
"learning_rate": 2.9827063490699224e-05,
"loss": 0.5298691749572754,
"mean_token_accuracy": 0.8524676557630301,
"num_tokens": 23297655.0,
"step": 4360
},
{
"entropy": 0.5880491819232703,
"epoch": 0.7571114552089312,
"grad_norm": 0.2216796875,
"learning_rate": 2.942834789062876e-05,
"loss": 0.6208145141601562,
"mean_token_accuracy": 0.8424996003508568,
"num_tokens": 23348699.0,
"step": 4370
},
{
"entropy": 0.5774009396787733,
"epoch": 0.7588439757014,
"grad_norm": 0.1875,
"learning_rate": 2.9031854899728483e-05,
"loss": 0.5922607421875,
"mean_token_accuracy": 0.8419295348227024,
"num_tokens": 23402802.0,
"step": 4380
},
{
"entropy": 0.5759732277598232,
"epoch": 0.760576496193869,
"grad_norm": 0.1962890625,
"learning_rate": 2.8637597005292293e-05,
"loss": 0.5788041114807129,
"mean_token_accuracy": 0.8396513409912586,
"num_tokens": 23456158.0,
"step": 4390
},
{
"entropy": 0.5810914925299585,
"epoch": 0.762309016686338,
"grad_norm": 0.283203125,
"learning_rate": 2.8245586624221077e-05,
"loss": 0.5863104343414307,
"mean_token_accuracy": 0.8429031614214182,
"num_tokens": 23509433.0,
"step": 4400
},
{
"entropy": 0.5689767023082822,
"epoch": 0.764041537178807,
"grad_norm": 0.275390625,
"learning_rate": 2.7855836102631706e-05,
"loss": 0.5630904197692871,
"mean_token_accuracy": 0.8441053662449122,
"num_tokens": 23562016.0,
"step": 4410
},
{
"entropy": 0.614728789892979,
"epoch": 0.7657740576712759,
"grad_norm": 0.251953125,
"learning_rate": 2.7468357715468295e-05,
"loss": 0.6392505168914795,
"mean_token_accuracy": 0.8323461454361677,
"num_tokens": 23617492.0,
"step": 4420
},
{
"entropy": 0.5409275959711521,
"epoch": 0.7675065781637448,
"grad_norm": 0.1962890625,
"learning_rate": 2.7083163666115564e-05,
"loss": 0.5301029682159424,
"mean_token_accuracy": 0.850815711542964,
"num_tokens": 23670181.0,
"step": 4430
},
{
"entropy": 0.5779091130942107,
"epoch": 0.7692390986562138,
"grad_norm": 0.291015625,
"learning_rate": 2.670026608601429e-05,
"loss": 0.5737006187438964,
"mean_token_accuracy": 0.8406471200287342,
"num_tokens": 23715480.0,
"step": 4440
},
{
"entropy": 0.5803326781373471,
"epoch": 0.7709716191486827,
"grad_norm": 0.2314453125,
"learning_rate": 2.6319677034279588e-05,
"loss": 0.594749927520752,
"mean_token_accuracy": 0.8403228733688592,
"num_tokens": 23771140.0,
"step": 4450
},
{
"entropy": 0.5970675764605403,
"epoch": 0.7727041396411517,
"grad_norm": 0.1962890625,
"learning_rate": 2.5941408497320918e-05,
"loss": 0.584465217590332,
"mean_token_accuracy": 0.8358738787472249,
"num_tokens": 23821701.0,
"step": 4460
},
{
"entropy": 0.5566497812396847,
"epoch": 0.7744366601336207,
"grad_norm": 0.171875,
"learning_rate": 2.556547238846456e-05,
"loss": 0.5480396747589111,
"mean_token_accuracy": 0.8482368070632219,
"num_tokens": 23877867.0,
"step": 4470
},
{
"entropy": 0.6114168071071617,
"epoch": 0.7761691806260896,
"grad_norm": 0.1826171875,
"learning_rate": 2.519188054757844e-05,
"loss": 0.6127332210540771,
"mean_token_accuracy": 0.8352025974541902,
"num_tokens": 23929405.0,
"step": 4480
},
{
"entropy": 0.5839661170262843,
"epoch": 0.7779017011185585,
"grad_norm": 0.255859375,
"learning_rate": 2.482064474069933e-05,
"loss": 0.6061002254486084,
"mean_token_accuracy": 0.8387925371527671,
"num_tokens": 23986820.0,
"step": 4490
},
{
"entropy": 0.5634350700303912,
"epoch": 0.7796342216110275,
"grad_norm": 0.24609375,
"learning_rate": 2.4451776659662208e-05,
"loss": 0.5573660850524902,
"mean_token_accuracy": 0.8468219470232725,
"num_tokens": 24042717.0,
"step": 4500
},
{
"entropy": 0.6055240669287741,
"epoch": 0.7813667421034964,
"grad_norm": 0.2080078125,
"learning_rate": 2.408528792173197e-05,
"loss": 0.6256453514099121,
"mean_token_accuracy": 0.8374260023236275,
"num_tokens": 24091266.0,
"step": 4510
},
{
"entropy": 0.5546964854118415,
"epoch": 0.7830992625959654,
"grad_norm": 0.21875,
"learning_rate": 2.3721190069237654e-05,
"loss": 0.5397284984588623,
"mean_token_accuracy": 0.8491404488682747,
"num_tokens": 24151273.0,
"step": 4520
},
{
"entropy": 0.5505000121425837,
"epoch": 0.7848317830884344,
"grad_norm": 0.20703125,
"learning_rate": 2.3359494569208928e-05,
"loss": 0.5483803272247314,
"mean_token_accuracy": 0.8495641268789769,
"num_tokens": 24206696.0,
"step": 4530
},
{
"entropy": 0.5746214020065963,
"epoch": 0.7865643035809033,
"grad_norm": 0.263671875,
"learning_rate": 2.3000212813014833e-05,
"loss": 0.5868116855621338,
"mean_token_accuracy": 0.8428641192615032,
"num_tokens": 24259880.0,
"step": 4540
},
{
"entropy": 0.5514689449686557,
"epoch": 0.7882968240733722,
"grad_norm": 0.20703125,
"learning_rate": 2.264335611600511e-05,
"loss": 0.5632360458374024,
"mean_token_accuracy": 0.8478600643575191,
"num_tokens": 24311579.0,
"step": 4550
},
{
"entropy": 0.5926326899789274,
"epoch": 0.7900293445658412,
"grad_norm": 0.2265625,
"learning_rate": 2.2288935717153826e-05,
"loss": 0.5733819484710694,
"mean_token_accuracy": 0.8435305185616017,
"num_tokens": 24363728.0,
"step": 4560
},
{
"entropy": 0.5693248523864896,
"epoch": 0.7917618650583101,
"grad_norm": 0.263671875,
"learning_rate": 2.1936962778705418e-05,
"loss": 0.5535439491271973,
"mean_token_accuracy": 0.8427335467189551,
"num_tokens": 24417545.0,
"step": 4570
},
{
"entropy": 0.5928860791958869,
"epoch": 0.7934943855507791,
"grad_norm": 0.2080078125,
"learning_rate": 2.158744838582305e-05,
"loss": 0.6109635829925537,
"mean_token_accuracy": 0.8377186991274357,
"num_tokens": 24469529.0,
"step": 4580
},
{
"entropy": 0.5517147674690932,
"epoch": 0.7952269060432481,
"grad_norm": 0.19140625,
"learning_rate": 2.1240403546239573e-05,
"loss": 0.55843505859375,
"mean_token_accuracy": 0.8467742208391428,
"num_tokens": 24526586.0,
"step": 4590
},
{
"entropy": 0.5572149983141571,
"epoch": 0.7969594265357169,
"grad_norm": 0.201171875,
"learning_rate": 2.0895839189910903e-05,
"loss": 0.5667229175567627,
"mean_token_accuracy": 0.8488913148641586,
"num_tokens": 24583652.0,
"step": 4600
},
{
"entropy": 0.5736112500540912,
"epoch": 0.7986919470281859,
"grad_norm": 0.2099609375,
"learning_rate": 2.055376616867164e-05,
"loss": 0.5669754028320313,
"mean_token_accuracy": 0.8435257486999035,
"num_tokens": 24642176.0,
"step": 4610
},
{
"entropy": 0.579422784037888,
"epoch": 0.8004244675206549,
"grad_norm": 0.2392578125,
"learning_rate": 2.0214195255893363e-05,
"loss": 0.5869145870208741,
"mean_token_accuracy": 0.8378935415297747,
"num_tokens": 24699945.0,
"step": 4620
},
{
"entropy": 0.6002859427593649,
"epoch": 0.8021569880131239,
"grad_norm": 0.203125,
"learning_rate": 1.987713714614543e-05,
"loss": 0.6259641647338867,
"mean_token_accuracy": 0.8333838868886232,
"num_tokens": 24755005.0,
"step": 4630
},
{
"entropy": 0.5577911037951708,
"epoch": 0.8038895085055928,
"grad_norm": 0.1728515625,
"learning_rate": 1.9542602454858038e-05,
"loss": 0.5876730442047119,
"mean_token_accuracy": 0.8446177303791046,
"num_tokens": 24807589.0,
"step": 4640
},
{
"entropy": 0.5511742249131203,
"epoch": 0.8056220289980618,
"grad_norm": 0.2119140625,
"learning_rate": 1.9210601717987886e-05,
"loss": 0.5123077392578125,
"mean_token_accuracy": 0.8508127823472023,
"num_tokens": 24862286.0,
"step": 4650
},
{
"entropy": 0.5655517499893904,
"epoch": 0.8073545494905306,
"grad_norm": 0.236328125,
"learning_rate": 1.8881145391686383e-05,
"loss": 0.5731409549713135,
"mean_token_accuracy": 0.8426301058381795,
"num_tokens": 24919245.0,
"step": 4660
},
{
"entropy": 0.5823489186353982,
"epoch": 0.8090870699829996,
"grad_norm": 0.1611328125,
"learning_rate": 1.8554243851970465e-05,
"loss": 0.5956488132476807,
"mean_token_accuracy": 0.8402592360973358,
"num_tokens": 24972322.0,
"step": 4670
},
{
"entropy": 0.615665140748024,
"epoch": 0.8108195904754686,
"grad_norm": 0.244140625,
"learning_rate": 1.822990739439556e-05,
"loss": 0.6114068984985351,
"mean_token_accuracy": 0.8344416070729495,
"num_tokens": 25026301.0,
"step": 4680
},
{
"entropy": 0.5908701654989272,
"epoch": 0.8125521109679376,
"grad_norm": 0.1943359375,
"learning_rate": 1.7908146233731516e-05,
"loss": 0.5971941947937012,
"mean_token_accuracy": 0.8422229964286089,
"num_tokens": 25082425.0,
"step": 4690
},
{
"entropy": 0.6170886626467109,
"epoch": 0.8142846314604065,
"grad_norm": 0.255859375,
"learning_rate": 1.758897050364089e-05,
"loss": 0.6370350360870362,
"mean_token_accuracy": 0.8319076154381037,
"num_tokens": 25141282.0,
"step": 4700
},
{
"entropy": 0.5807770256418735,
"epoch": 0.8160171519528755,
"grad_norm": 0.236328125,
"learning_rate": 1.7272390256359726e-05,
"loss": 0.5834021091461181,
"mean_token_accuracy": 0.8393303919583559,
"num_tokens": 25192984.0,
"step": 4710
},
{
"entropy": 0.5795641975477338,
"epoch": 0.8177496724453444,
"grad_norm": 0.2001953125,
"learning_rate": 1.6958415462380982e-05,
"loss": 0.5941871166229248,
"mean_token_accuracy": 0.842550129443407,
"num_tokens": 25247078.0,
"step": 4720
},
{
"entropy": 0.5757013593101874,
"epoch": 0.8194821929378133,
"grad_norm": 0.2158203125,
"learning_rate": 1.6647056010140494e-05,
"loss": 0.6085315227508545,
"mean_token_accuracy": 0.8438326179981231,
"num_tokens": 25297441.0,
"step": 4730
},
{
"entropy": 0.5631363501306623,
"epoch": 0.8212147134302823,
"grad_norm": 0.181640625,
"learning_rate": 1.633832170570565e-05,
"loss": 0.5446923255920411,
"mean_token_accuracy": 0.8464885164052248,
"num_tokens": 25351087.0,
"step": 4740
},
{
"entropy": 0.5960177618311718,
"epoch": 0.8229472339227513,
"grad_norm": 0.18359375,
"learning_rate": 1.6032222272466456e-05,
"loss": 0.6015133857727051,
"mean_token_accuracy": 0.8357700191438198,
"num_tokens": 25406833.0,
"step": 4750
},
{
"entropy": 0.5622742976062,
"epoch": 0.8246797544152202,
"grad_norm": 0.267578125,
"learning_rate": 1.572876735082931e-05,
"loss": 0.5792129039764404,
"mean_token_accuracy": 0.8478969302028417,
"num_tokens": 25462922.0,
"step": 4760
},
{
"entropy": 0.5860844446811825,
"epoch": 0.8264122749076891,
"grad_norm": 0.1396484375,
"learning_rate": 1.5427966497913382e-05,
"loss": 0.5700845718383789,
"mean_token_accuracy": 0.8390550728887319,
"num_tokens": 25519835.0,
"step": 4770
},
{
"entropy": 0.5723399114562199,
"epoch": 0.8281447954001581,
"grad_norm": 0.205078125,
"learning_rate": 1.5129829187249733e-05,
"loss": 0.5587327480316162,
"mean_token_accuracy": 0.8436962455511093,
"num_tokens": 25572862.0,
"step": 4780
},
{
"entropy": 0.6173130693845451,
"epoch": 0.829877315892627,
"grad_norm": 0.24609375,
"learning_rate": 1.483436480848276e-05,
"loss": 0.6014991283416748,
"mean_token_accuracy": 0.8375725369900465,
"num_tokens": 25619756.0,
"step": 4790
},
{
"entropy": 0.5997563745826483,
"epoch": 0.831609836385096,
"grad_norm": 0.2158203125,
"learning_rate": 1.4541582667074605e-05,
"loss": 0.6501627922058105,
"mean_token_accuracy": 0.8382502742111683,
"num_tokens": 25672657.0,
"step": 4800
},
{
"entropy": 0.6088074346072971,
"epoch": 0.833342356877565,
"grad_norm": 0.2333984375,
"learning_rate": 1.425149198401209e-05,
"loss": 0.6090521335601806,
"mean_token_accuracy": 0.8370539605617523,
"num_tokens": 25726543.0,
"step": 4810
},
{
"entropy": 0.5758180576376617,
"epoch": 0.8350748773700339,
"grad_norm": 0.1787109375,
"learning_rate": 1.3964101895516258e-05,
"loss": 0.5777298927307128,
"mean_token_accuracy": 0.8420398116111756,
"num_tokens": 25780444.0,
"step": 4820
},
{
"entropy": 0.5725994257256388,
"epoch": 0.8368073978625028,
"grad_norm": 0.173828125,
"learning_rate": 1.3679421452754627e-05,
"loss": 0.6158907890319825,
"mean_token_accuracy": 0.8438146792352199,
"num_tokens": 25833018.0,
"step": 4830
},
{
"entropy": 0.5271360840764828,
"epoch": 0.8385399183549718,
"grad_norm": 0.1796875,
"learning_rate": 1.339745962155613e-05,
"loss": 0.4843564033508301,
"mean_token_accuracy": 0.8528855789452792,
"num_tokens": 25885932.0,
"step": 4840
},
{
"entropy": 0.5767460000701249,
"epoch": 0.8402724388474407,
"grad_norm": 0.1669921875,
"learning_rate": 1.311822528212886e-05,
"loss": 0.5902610778808594,
"mean_token_accuracy": 0.8412225931882858,
"num_tokens": 25935679.0,
"step": 4850
},
{
"entropy": 0.5638484083116054,
"epoch": 0.8420049593399097,
"grad_norm": 0.208984375,
"learning_rate": 1.2841727228780187e-05,
"loss": 0.5590053081512452,
"mean_token_accuracy": 0.8466204077005386,
"num_tokens": 25990464.0,
"step": 4860
},
{
"entropy": 0.5571088962838985,
"epoch": 0.8437374798323787,
"grad_norm": 0.2119140625,
"learning_rate": 1.256797416963994e-05,
"loss": 0.5606691360473632,
"mean_token_accuracy": 0.8445250861346721,
"num_tokens": 26047087.0,
"step": 4870
},
{
"entropy": 0.5812531022820622,
"epoch": 0.8454700003248475,
"grad_norm": 0.23046875,
"learning_rate": 1.2296974726386123e-05,
"loss": 0.595766830444336,
"mean_token_accuracy": 0.8446589518338442,
"num_tokens": 26098529.0,
"step": 4880
},
{
"entropy": 0.5640038163866847,
"epoch": 0.8472025208173165,
"grad_norm": 0.177734375,
"learning_rate": 1.2028737433973358e-05,
"loss": 0.5880807399749756,
"mean_token_accuracy": 0.8454778704792261,
"num_tokens": 26152935.0,
"step": 4890
},
{
"entropy": 0.5730855024885386,
"epoch": 0.8489350413097855,
"grad_norm": 0.2041015625,
"learning_rate": 1.1763270740364073e-05,
"loss": 0.5882959842681885,
"mean_token_accuracy": 0.8418738380074501,
"num_tokens": 26207299.0,
"step": 4900
},
{
"entropy": 0.563043595594354,
"epoch": 0.8506675618022544,
"grad_norm": 0.296875,
"learning_rate": 1.1500583006262423e-05,
"loss": 0.587392520904541,
"mean_token_accuracy": 0.8417437814176083,
"num_tokens": 26259660.0,
"step": 4910
},
{
"entropy": 0.5787749814800918,
"epoch": 0.8524000822947234,
"grad_norm": 0.2734375,
"learning_rate": 1.1240682504851096e-05,
"loss": 0.5740055561065673,
"mean_token_accuracy": 0.8416815143078565,
"num_tokens": 26316406.0,
"step": 4920
},
{
"entropy": 0.5916237368946895,
"epoch": 0.8541326027871924,
"grad_norm": 0.201171875,
"learning_rate": 1.0983577421530578e-05,
"loss": 0.6176825046539307,
"mean_token_accuracy": 0.8374281879514456,
"num_tokens": 26371506.0,
"step": 4930
},
{
"entropy": 0.5775140485726297,
"epoch": 0.8558651232796612,
"grad_norm": 0.197265625,
"learning_rate": 1.0729275853661503e-05,
"loss": 0.5840110778808594,
"mean_token_accuracy": 0.8430575907230378,
"num_tokens": 26430372.0,
"step": 4940
},
{
"entropy": 0.5944045529700815,
"epoch": 0.8575976437721302,
"grad_norm": 0.19921875,
"learning_rate": 1.0477785810309504e-05,
"loss": 0.5982850074768067,
"mean_token_accuracy": 0.8358097314834595,
"num_tokens": 26483187.0,
"step": 4950
},
{
"entropy": 0.5662330114166252,
"epoch": 0.8593301642645992,
"grad_norm": 0.228515625,
"learning_rate": 1.0229115211993146e-05,
"loss": 0.5489250183105469,
"mean_token_accuracy": 0.8467546600848437,
"num_tokens": 26531742.0,
"step": 4960
},
{
"entropy": 0.5814009133726359,
"epoch": 0.8610626847570682,
"grad_norm": 0.197265625,
"learning_rate": 9.983271890434276e-06,
"loss": 0.5658225059509278,
"mean_token_accuracy": 0.8422036103904247,
"num_tokens": 26582463.0,
"step": 4970
},
{
"entropy": 0.5738571006804705,
"epoch": 0.8627952052495371,
"grad_norm": 0.1904296875,
"learning_rate": 9.740263588311493e-06,
"loss": 0.5560882568359375,
"mean_token_accuracy": 0.8477094814181327,
"num_tokens": 26635409.0,
"step": 4980
},
{
"entropy": 0.6064791481010616,
"epoch": 0.8645277257420061,
"grad_norm": 0.208984375,
"learning_rate": 9.500097959016296e-06,
"loss": 0.5998945236206055,
"mean_token_accuracy": 0.8359555754810571,
"num_tokens": 26688814.0,
"step": 4990
},
{
"entropy": 0.6118629967328161,
"epoch": 0.866260246234475,
"grad_norm": 0.2177734375,
"learning_rate": 9.262782566411977e-06,
"loss": 0.6543556690216065,
"mean_token_accuracy": 0.8329808592796326,
"num_tokens": 26739296.0,
"step": 5000
}
],
"logging_steps": 10,
"max_steps": 5772,
"num_input_tokens_seen": 0,
"num_train_epochs": 1,
"save_steps": 200,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": false
},
"attributes": {}
}
},
"total_flos": 1.1408570883984261e+18,
"train_batch_size": 1,
"trial_name": null,
"trial_params": null
}