{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 0.866260246234475, "eval_steps": 0, "global_step": 5000, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "entropy": 0.810929330997169, "epoch": 0.00173252049246895, "grad_norm": 0.205078125, "learning_rate": 1.0344827586206897e-05, "loss": 1.254616641998291, "mean_token_accuracy": 0.7005728678777814, "num_tokens": 55845.0, "step": 10 }, { "entropy": 0.8157925633713603, "epoch": 0.0034650409849379, "grad_norm": 0.2197265625, "learning_rate": 2.183908045977012e-05, "loss": 1.2245146751403808, "mean_token_accuracy": 0.708231895044446, "num_tokens": 113111.0, "step": 20 }, { "entropy": 0.8832647049799561, "epoch": 0.00519756147740685, "grad_norm": 0.25, "learning_rate": 3.3333333333333335e-05, "loss": 1.1657934188842773, "mean_token_accuracy": 0.7022482370957732, "num_tokens": 164227.0, "step": 30 }, { "entropy": 0.9586381811648608, "epoch": 0.0069300819698758, "grad_norm": 0.298828125, "learning_rate": 4.482758620689655e-05, "loss": 1.0330963134765625, "mean_token_accuracy": 0.7396623624488712, "num_tokens": 217441.0, "step": 40 }, { "entropy": 0.9550106849521398, "epoch": 0.00866260246234475, "grad_norm": 0.3828125, "learning_rate": 5.632183908045977e-05, "loss": 0.8959432601928711, "mean_token_accuracy": 0.7642454300075769, "num_tokens": 268289.0, "step": 50 }, { "entropy": 0.7945327928289772, "epoch": 0.0103951229548137, "grad_norm": 0.173828125, "learning_rate": 6.781609195402298e-05, "loss": 0.7625956058502197, "mean_token_accuracy": 0.8002910505980253, "num_tokens": 324346.0, "step": 60 }, { "entropy": 0.7771458545699715, "epoch": 0.01212764344728265, "grad_norm": 0.26171875, "learning_rate": 7.931034482758621e-05, "loss": 0.7818475723266601, "mean_token_accuracy": 0.8028205497190356, "num_tokens": 377817.0, "step": 70 }, { "entropy": 0.7179010029882192, "epoch": 0.0138601639397516, "grad_norm": 0.14453125, "learning_rate": 9.080459770114943e-05, "loss": 0.7082338809967041, "mean_token_accuracy": 0.8104276180267334, "num_tokens": 430404.0, "step": 80 }, { "entropy": 0.6860609723255038, "epoch": 0.01559268443222055, "grad_norm": 0.1669921875, "learning_rate": 0.00010229885057471265, "loss": 0.7078627109527588, "mean_token_accuracy": 0.8185620239004493, "num_tokens": 485403.0, "step": 90 }, { "entropy": 0.7082041744142771, "epoch": 0.0173252049246895, "grad_norm": 0.224609375, "learning_rate": 0.00011379310344827588, "loss": 0.6847227573394775, "mean_token_accuracy": 0.813801309466362, "num_tokens": 540316.0, "step": 100 }, { "entropy": 0.7132678747177124, "epoch": 0.01905772541715845, "grad_norm": 0.150390625, "learning_rate": 0.00012528735632183908, "loss": 0.7346933841705322, "mean_token_accuracy": 0.8136965841054916, "num_tokens": 596090.0, "step": 110 }, { "entropy": 0.6739615526981652, "epoch": 0.0207902459096274, "grad_norm": 0.197265625, "learning_rate": 0.0001367816091954023, "loss": 0.7035027980804444, "mean_token_accuracy": 0.8202918566763401, "num_tokens": 652251.0, "step": 120 }, { "entropy": 0.7046921165660024, "epoch": 0.02252276640209635, "grad_norm": 0.2216796875, "learning_rate": 0.00014827586206896554, "loss": 0.7162999153137207, "mean_token_accuracy": 0.8211559295654297, "num_tokens": 705549.0, "step": 130 }, { "entropy": 0.653735039010644, "epoch": 0.0242552868945653, "grad_norm": 0.2001953125, "learning_rate": 0.00015977011494252874, "loss": 0.6981287002563477, "mean_token_accuracy": 0.82376406211406, "num_tokens": 761437.0, "step": 140 }, { "entropy": 0.6913811397738755, "epoch": 0.02598780738703425, "grad_norm": 0.2138671875, "learning_rate": 0.00017126436781609197, "loss": 0.6812327861785888, "mean_token_accuracy": 0.8214046888053417, "num_tokens": 815757.0, "step": 150 }, { "entropy": 0.6818532709032297, "epoch": 0.0277203278795032, "grad_norm": 0.14453125, "learning_rate": 0.00018275862068965518, "loss": 0.6739168643951416, "mean_token_accuracy": 0.8230750940740108, "num_tokens": 870566.0, "step": 160 }, { "entropy": 0.6293836037628353, "epoch": 0.02945284837197215, "grad_norm": 0.1962890625, "learning_rate": 0.0001942528735632184, "loss": 0.6438039302825928, "mean_token_accuracy": 0.8250031888484954, "num_tokens": 919572.0, "step": 170 }, { "entropy": 0.7395828457549214, "epoch": 0.0311853688644411, "grad_norm": 0.236328125, "learning_rate": 0.000199999606319698, "loss": 0.7348537921905518, "mean_token_accuracy": 0.8079655442386866, "num_tokens": 976518.0, "step": 180 }, { "entropy": 0.6470751653891057, "epoch": 0.03291788935691005, "grad_norm": 0.1923828125, "learning_rate": 0.0001999964568958801, "loss": 0.6475263118743897, "mean_token_accuracy": 0.8273555610328913, "num_tokens": 1029982.0, "step": 190 }, { "entropy": 0.6638997793197632, "epoch": 0.034650409849379, "grad_norm": 0.1787109375, "learning_rate": 0.00019999015814743337, "loss": 0.6720759868621826, "mean_token_accuracy": 0.8212123598903418, "num_tokens": 1083520.0, "step": 200 }, { "entropy": 0.6658276095055043, "epoch": 0.03638293034184795, "grad_norm": 0.1796875, "learning_rate": 0.00019998071027273287, "loss": 0.6466164588928223, "mean_token_accuracy": 0.824113554507494, "num_tokens": 1140398.0, "step": 210 }, { "entropy": 0.6653693447820842, "epoch": 0.0381154508343169, "grad_norm": 0.1796875, "learning_rate": 0.00019996811356933346, "loss": 0.7165875911712647, "mean_token_accuracy": 0.8195627685636282, "num_tokens": 1199606.0, "step": 220 }, { "entropy": 0.6407551797106862, "epoch": 0.03984797132678585, "grad_norm": 0.1767578125, "learning_rate": 0.00019995236843396017, "loss": 0.6214494228363037, "mean_token_accuracy": 0.8284068278968334, "num_tokens": 1255643.0, "step": 230 }, { "entropy": 0.6598921860568225, "epoch": 0.0415804918192548, "grad_norm": 0.1875, "learning_rate": 0.00019993347536249607, "loss": 0.6686903476715088, "mean_token_accuracy": 0.825398787111044, "num_tokens": 1307549.0, "step": 240 }, { "entropy": 0.6621891765855252, "epoch": 0.04331301231172375, "grad_norm": 0.162109375, "learning_rate": 0.0001999114349499664, "loss": 0.6639114379882812, "mean_token_accuracy": 0.8296613309532404, "num_tokens": 1357737.0, "step": 250 }, { "entropy": 0.6813261322677135, "epoch": 0.0450455328041927, "grad_norm": 0.2275390625, "learning_rate": 0.00019988624789051983, "loss": 0.6541904926300048, "mean_token_accuracy": 0.8254248831421137, "num_tokens": 1408003.0, "step": 260 }, { "entropy": 0.6344376143068076, "epoch": 0.04677805329666165, "grad_norm": 0.1396484375, "learning_rate": 0.00019985791497740678, "loss": 0.6409160137176514, "mean_token_accuracy": 0.8295672092586756, "num_tokens": 1468512.0, "step": 270 }, { "entropy": 0.6638527356088162, "epoch": 0.0485105737891306, "grad_norm": 0.146484375, "learning_rate": 0.00019982643710295426, "loss": 0.6663234233856201, "mean_token_accuracy": 0.828643910959363, "num_tokens": 1523479.0, "step": 280 }, { "entropy": 0.6975623445119709, "epoch": 0.05024309428159955, "grad_norm": 0.197265625, "learning_rate": 0.0001997918152585379, "loss": 0.7597866058349609, "mean_token_accuracy": 0.8158255266025662, "num_tokens": 1576432.0, "step": 290 }, { "entropy": 0.6049194569699466, "epoch": 0.0519756147740685, "grad_norm": 0.203125, "learning_rate": 0.00019975405053455051, "loss": 0.5933527946472168, "mean_token_accuracy": 0.8358733810484409, "num_tokens": 1629231.0, "step": 300 }, { "entropy": 0.620193119905889, "epoch": 0.05370813526653745, "grad_norm": 0.173828125, "learning_rate": 0.00019971314412036808, "loss": 0.6208887100219727, "mean_token_accuracy": 0.8321478370577097, "num_tokens": 1679414.0, "step": 310 }, { "entropy": 0.6657766723074019, "epoch": 0.0554406557590064, "grad_norm": 0.166015625, "learning_rate": 0.00019966909730431196, "loss": 0.6897091865539551, "mean_token_accuracy": 0.8228034034371376, "num_tokens": 1737775.0, "step": 320 }, { "entropy": 0.644062434695661, "epoch": 0.05717317625147535, "grad_norm": 0.21875, "learning_rate": 0.00019962191147360856, "loss": 0.6630971908569336, "mean_token_accuracy": 0.8295374032109976, "num_tokens": 1792525.0, "step": 330 }, { "entropy": 0.6073618672788144, "epoch": 0.0589056967439443, "grad_norm": 0.234375, "learning_rate": 0.00019957158811434553, "loss": 0.624071455001831, "mean_token_accuracy": 0.8320268541574478, "num_tokens": 1842155.0, "step": 340 }, { "entropy": 0.6616941560059786, "epoch": 0.06063821723641325, "grad_norm": 0.181640625, "learning_rate": 0.00019951812881142497, "loss": 0.6492743015289306, "mean_token_accuracy": 0.8291781645268201, "num_tokens": 1899018.0, "step": 350 }, { "entropy": 0.6520219750702381, "epoch": 0.0623707377288822, "grad_norm": 0.201171875, "learning_rate": 0.00019946153524851351, "loss": 0.6957698822021484, "mean_token_accuracy": 0.8234761968255043, "num_tokens": 1951764.0, "step": 360 }, { "entropy": 0.6280029808636755, "epoch": 0.06410325822135116, "grad_norm": 0.2158203125, "learning_rate": 0.0001994018092079893, "loss": 0.6160636901855469, "mean_token_accuracy": 0.8326598234474659, "num_tokens": 2003098.0, "step": 370 }, { "entropy": 0.6201984202489257, "epoch": 0.0658357787138201, "grad_norm": 0.1298828125, "learning_rate": 0.00019933895257088596, "loss": 0.6358787059783936, "mean_token_accuracy": 0.831251024082303, "num_tokens": 2057015.0, "step": 380 }, { "entropy": 0.650082749966532, "epoch": 0.06756829920628905, "grad_norm": 0.1181640625, "learning_rate": 0.00019927296731683315, "loss": 0.6564774990081788, "mean_token_accuracy": 0.8291048884391785, "num_tokens": 2112697.0, "step": 390 }, { "entropy": 0.6485576028004288, "epoch": 0.069300819698758, "grad_norm": 0.1552734375, "learning_rate": 0.00019920385552399432, "loss": 0.6576817035675049, "mean_token_accuracy": 0.8271005995571613, "num_tokens": 2163939.0, "step": 400 }, { "entropy": 0.5890314053744078, "epoch": 0.07103334019122695, "grad_norm": 0.1328125, "learning_rate": 0.00019913161936900133, "loss": 0.5919264316558838, "mean_token_accuracy": 0.8378766164183616, "num_tokens": 2216098.0, "step": 410 }, { "entropy": 0.6104229719843716, "epoch": 0.0727658606836959, "grad_norm": 0.16796875, "learning_rate": 0.00019905626112688582, "loss": 0.609614372253418, "mean_token_accuracy": 0.8336421933025122, "num_tokens": 2267710.0, "step": 420 }, { "entropy": 0.6408540541771799, "epoch": 0.07449838117616485, "grad_norm": 0.169921875, "learning_rate": 0.00019897778317100754, "loss": 0.6390007495880127, "mean_token_accuracy": 0.8281146749854088, "num_tokens": 2316219.0, "step": 430 }, { "entropy": 0.6305070512928068, "epoch": 0.0762309016686338, "grad_norm": 0.2890625, "learning_rate": 0.00019889618797297968, "loss": 0.631248950958252, "mean_token_accuracy": 0.8325294002890586, "num_tokens": 2371925.0, "step": 440 }, { "entropy": 0.6037532315589488, "epoch": 0.07796342216110275, "grad_norm": 0.205078125, "learning_rate": 0.00019881147810259093, "loss": 0.6101105213165283, "mean_token_accuracy": 0.8346767805516719, "num_tokens": 2426625.0, "step": 450 }, { "entropy": 0.6217060944065451, "epoch": 0.0796959426535717, "grad_norm": 0.162109375, "learning_rate": 0.00019872365622772465, "loss": 0.6300463199615478, "mean_token_accuracy": 0.8344658222049475, "num_tokens": 2478515.0, "step": 460 }, { "entropy": 0.6248600482009351, "epoch": 0.08142846314604064, "grad_norm": 0.1806640625, "learning_rate": 0.00019863272511427474, "loss": 0.6302617073059082, "mean_token_accuracy": 0.8273205358535052, "num_tokens": 2532071.0, "step": 470 }, { "entropy": 0.6396009525284171, "epoch": 0.0831609836385096, "grad_norm": 0.224609375, "learning_rate": 0.00019853868762605866, "loss": 0.6199671268463135, "mean_token_accuracy": 0.8307142000645399, "num_tokens": 2589201.0, "step": 480 }, { "entropy": 0.6030260891653597, "epoch": 0.08489350413097856, "grad_norm": 0.1806640625, "learning_rate": 0.00019844154672472706, "loss": 0.6208174705505372, "mean_token_accuracy": 0.8347844246774911, "num_tokens": 2645142.0, "step": 490 }, { "entropy": 0.6636065155267715, "epoch": 0.0866260246234475, "grad_norm": 0.171875, "learning_rate": 0.00019834130546967073, "loss": 0.6683245182037354, "mean_token_accuracy": 0.8294202674180269, "num_tokens": 2699971.0, "step": 500 }, { "entropy": 0.6588667241856456, "epoch": 0.08835854511591645, "grad_norm": 0.232421875, "learning_rate": 0.00019823796701792405, "loss": 0.6521318435668946, "mean_token_accuracy": 0.8271396320313216, "num_tokens": 2755726.0, "step": 510 }, { "entropy": 0.6405920119024813, "epoch": 0.0900910656083854, "grad_norm": 0.1630859375, "learning_rate": 0.00019813153462406566, "loss": 0.6348390579223633, "mean_token_accuracy": 0.8277827233076096, "num_tokens": 2809331.0, "step": 520 }, { "entropy": 0.6443098559975624, "epoch": 0.09182358610085435, "grad_norm": 0.279296875, "learning_rate": 0.00019802201164011586, "loss": 0.6198469161987304, "mean_token_accuracy": 0.8291943591088057, "num_tokens": 2858441.0, "step": 530 }, { "entropy": 0.6293792264536023, "epoch": 0.0935561065933233, "grad_norm": 0.1533203125, "learning_rate": 0.0001979094015154312, "loss": 0.6151269912719727, "mean_token_accuracy": 0.8302976503968239, "num_tokens": 2912293.0, "step": 540 }, { "entropy": 0.6466425215825439, "epoch": 0.09528862708579225, "grad_norm": 0.1435546875, "learning_rate": 0.00019779370779659576, "loss": 0.6462889671325683, "mean_token_accuracy": 0.8293194837868214, "num_tokens": 2969052.0, "step": 550 }, { "entropy": 0.6073407874442637, "epoch": 0.0970211475782612, "grad_norm": 0.1533203125, "learning_rate": 0.00019767493412730936, "loss": 0.6346017360687256, "mean_token_accuracy": 0.8343164108693599, "num_tokens": 3025367.0, "step": 560 }, { "entropy": 0.5817480836063623, "epoch": 0.09875366807073015, "grad_norm": 0.193359375, "learning_rate": 0.00019755308424827304, "loss": 0.5833946228027344, "mean_token_accuracy": 0.8394967459142209, "num_tokens": 3074360.0, "step": 570 }, { "entropy": 0.6115848210640251, "epoch": 0.1004861885631991, "grad_norm": 0.1416015625, "learning_rate": 0.00019742816199707096, "loss": 0.5977429389953614, "mean_token_accuracy": 0.8364680297672749, "num_tokens": 3125265.0, "step": 580 }, { "entropy": 0.6274468263611197, "epoch": 0.10221870905566804, "grad_norm": 0.2255859375, "learning_rate": 0.00019730017130804975, "loss": 0.6550042152404785, "mean_token_accuracy": 0.8297880813479424, "num_tokens": 3173631.0, "step": 590 }, { "entropy": 0.6123087177053094, "epoch": 0.103951229548137, "grad_norm": 0.146484375, "learning_rate": 0.0001971691162121945, "loss": 0.6123240947723388, "mean_token_accuracy": 0.8380243465304374, "num_tokens": 3221993.0, "step": 600 }, { "entropy": 0.6288255278021098, "epoch": 0.10568375004060594, "grad_norm": 0.2041015625, "learning_rate": 0.00019703500083700194, "loss": 0.6531140327453613, "mean_token_accuracy": 0.8308754049241542, "num_tokens": 3270001.0, "step": 610 }, { "entropy": 0.6463912200182677, "epoch": 0.1074162705330749, "grad_norm": 0.23046875, "learning_rate": 0.0001968978294063502, "loss": 0.6550347805023193, "mean_token_accuracy": 0.8286161825060845, "num_tokens": 3319189.0, "step": 620 }, { "entropy": 0.6228113821707666, "epoch": 0.10914879102554385, "grad_norm": 0.15234375, "learning_rate": 0.00019675760624036603, "loss": 0.6403580665588379, "mean_token_accuracy": 0.8286291882395744, "num_tokens": 3375662.0, "step": 630 }, { "entropy": 0.615918574295938, "epoch": 0.1108813115180128, "grad_norm": 0.1708984375, "learning_rate": 0.00019661433575528857, "loss": 0.612631368637085, "mean_token_accuracy": 0.8331956438720226, "num_tokens": 3424137.0, "step": 640 }, { "entropy": 0.6141920768655836, "epoch": 0.11261383201048175, "grad_norm": 0.1494140625, "learning_rate": 0.0001964680224633304, "loss": 0.6380485534667969, "mean_token_accuracy": 0.8324795596301555, "num_tokens": 3475797.0, "step": 650 }, { "entropy": 0.6042345489375294, "epoch": 0.1143463525029507, "grad_norm": 0.1533203125, "learning_rate": 0.00019631867097253528, "loss": 0.6176069736480713, "mean_token_accuracy": 0.8363753166049719, "num_tokens": 3529500.0, "step": 660 }, { "entropy": 0.6391982820816338, "epoch": 0.11607887299541965, "grad_norm": 0.197265625, "learning_rate": 0.00019616628598663322, "loss": 0.6678025245666503, "mean_token_accuracy": 0.8258381471037864, "num_tokens": 3581994.0, "step": 670 }, { "entropy": 0.6329770868644118, "epoch": 0.1178113934878886, "grad_norm": 0.205078125, "learning_rate": 0.0001960108723048921, "loss": 0.6337652206420898, "mean_token_accuracy": 0.8345998499542475, "num_tokens": 3638782.0, "step": 680 }, { "entropy": 0.6326605278067291, "epoch": 0.11954391398035755, "grad_norm": 0.14453125, "learning_rate": 0.0001958524348219667, "loss": 0.6063634872436523, "mean_token_accuracy": 0.832572503387928, "num_tokens": 3691273.0, "step": 690 }, { "entropy": 0.5810540007427335, "epoch": 0.1212764344728265, "grad_norm": 0.19140625, "learning_rate": 0.00019569097852774453, "loss": 0.594770860671997, "mean_token_accuracy": 0.8386940393596888, "num_tokens": 3745624.0, "step": 700 }, { "entropy": 0.588012866396457, "epoch": 0.12300895496529544, "grad_norm": 0.166015625, "learning_rate": 0.0001955265085071886, "loss": 0.6192033767700196, "mean_token_accuracy": 0.8409584548324347, "num_tokens": 3795503.0, "step": 710 }, { "entropy": 0.6364398309960961, "epoch": 0.1247414754577644, "grad_norm": 0.1328125, "learning_rate": 0.00019535902994017722, "loss": 0.6561676979064941, "mean_token_accuracy": 0.8255573306232691, "num_tokens": 3851187.0, "step": 720 }, { "entropy": 0.619802868552506, "epoch": 0.12647399595023334, "grad_norm": 0.201171875, "learning_rate": 0.0001951885481013411, "loss": 0.6344377994537354, "mean_token_accuracy": 0.8339987032115459, "num_tokens": 3899124.0, "step": 730 }, { "entropy": 0.6206785554066301, "epoch": 0.1282065164427023, "grad_norm": 0.1455078125, "learning_rate": 0.00019501506835989697, "loss": 0.631008529663086, "mean_token_accuracy": 0.8334441259503365, "num_tokens": 3959861.0, "step": 740 }, { "entropy": 0.5827660778537392, "epoch": 0.12993903693517125, "grad_norm": 0.1630859375, "learning_rate": 0.00019483859617947872, "loss": 0.5870482444763183, "mean_token_accuracy": 0.8423280280083418, "num_tokens": 4011262.0, "step": 750 }, { "entropy": 0.5850820791441947, "epoch": 0.1316715574276402, "grad_norm": 0.158203125, "learning_rate": 0.000194659137117965, "loss": 0.5706618785858154, "mean_token_accuracy": 0.835949943959713, "num_tokens": 4066973.0, "step": 760 }, { "entropy": 0.5861118984874338, "epoch": 0.13340407792010914, "grad_norm": 0.14453125, "learning_rate": 0.00019447669682730458, "loss": 0.5910950183868409, "mean_token_accuracy": 0.8391546167433261, "num_tokens": 4122334.0, "step": 770 }, { "entropy": 0.6104440504685045, "epoch": 0.1351365984125781, "grad_norm": 0.1552734375, "learning_rate": 0.00019429128105333802, "loss": 0.6063616752624512, "mean_token_accuracy": 0.8353819210082293, "num_tokens": 4169982.0, "step": 780 }, { "entropy": 0.5728639733977616, "epoch": 0.13686911890504705, "grad_norm": 0.15625, "learning_rate": 0.00019410289563561684, "loss": 0.5704578399658203, "mean_token_accuracy": 0.8447943590581417, "num_tokens": 4224171.0, "step": 790 }, { "entropy": 0.629005889594555, "epoch": 0.138601639397516, "grad_norm": 0.1884765625, "learning_rate": 0.0001939115465072196, "loss": 0.6602046966552735, "mean_token_accuracy": 0.8233518835157156, "num_tokens": 4277323.0, "step": 800 }, { "entropy": 0.656224881671369, "epoch": 0.14033415988998496, "grad_norm": 0.1884765625, "learning_rate": 0.0001937172396945651, "loss": 0.6153887271881103, "mean_token_accuracy": 0.8298857126384973, "num_tokens": 4335646.0, "step": 810 }, { "entropy": 0.5757689834572375, "epoch": 0.1420666803824539, "grad_norm": 0.1923828125, "learning_rate": 0.00019351998131722243, "loss": 0.5900076866149903, "mean_token_accuracy": 0.8418699573725462, "num_tokens": 4388682.0, "step": 820 }, { "entropy": 0.6217615368776024, "epoch": 0.14379920087492284, "grad_norm": 0.2197265625, "learning_rate": 0.0001933197775877184, "loss": 0.6482601642608643, "mean_token_accuracy": 0.8346694391220808, "num_tokens": 4442000.0, "step": 830 }, { "entropy": 0.6114513349719346, "epoch": 0.1455317213673918, "grad_norm": 0.2060546875, "learning_rate": 0.00019311663481134174, "loss": 0.582618522644043, "mean_token_accuracy": 0.8370612319558859, "num_tokens": 4498203.0, "step": 840 }, { "entropy": 0.6372988875955343, "epoch": 0.14726424185986076, "grad_norm": 0.1806640625, "learning_rate": 0.00019291055938594462, "loss": 0.6404173374176025, "mean_token_accuracy": 0.8303977962583303, "num_tokens": 4552204.0, "step": 850 }, { "entropy": 0.6316783194430172, "epoch": 0.1489967623523297, "grad_norm": 0.2158203125, "learning_rate": 0.00019270155780174114, "loss": 0.656841516494751, "mean_token_accuracy": 0.829747848957777, "num_tokens": 4604813.0, "step": 860 }, { "entropy": 0.641633422859013, "epoch": 0.15072928284479864, "grad_norm": 0.1943359375, "learning_rate": 0.00019248963664110288, "loss": 0.6612475395202637, "mean_token_accuracy": 0.8291548546403646, "num_tokens": 4661699.0, "step": 870 }, { "entropy": 0.5630314766429365, "epoch": 0.1524618033372676, "grad_norm": 0.126953125, "learning_rate": 0.00019227480257835163, "loss": 0.5817951679229736, "mean_token_accuracy": 0.8393433384597302, "num_tokens": 4718774.0, "step": 880 }, { "entropy": 0.5991185949184, "epoch": 0.15419432382973655, "grad_norm": 0.126953125, "learning_rate": 0.00019205706237954915, "loss": 0.5823598861694336, "mean_token_accuracy": 0.8372795689851046, "num_tokens": 4772837.0, "step": 890 }, { "entropy": 0.6217554544098676, "epoch": 0.1559268443222055, "grad_norm": 0.1650390625, "learning_rate": 0.00019183642290228415, "loss": 0.6203337669372558, "mean_token_accuracy": 0.8345170859247446, "num_tokens": 4826993.0, "step": 900 }, { "entropy": 0.6516272252425551, "epoch": 0.15765936481467444, "grad_norm": 0.150390625, "learning_rate": 0.00019161289109545618, "loss": 0.6951152801513671, "mean_token_accuracy": 0.8220154713839293, "num_tokens": 4879529.0, "step": 910 }, { "entropy": 0.6168920679949224, "epoch": 0.1593918853071434, "grad_norm": 0.16796875, "learning_rate": 0.000191386473999057, "loss": 0.6254449844360351, "mean_token_accuracy": 0.8336785022169352, "num_tokens": 4936217.0, "step": 920 }, { "entropy": 0.6057372880168259, "epoch": 0.16112440579961235, "grad_norm": 0.2021484375, "learning_rate": 0.00019115717874394856, "loss": 0.5920339584350586, "mean_token_accuracy": 0.8377459555864334, "num_tokens": 4991428.0, "step": 930 }, { "entropy": 0.596577781997621, "epoch": 0.1628569262920813, "grad_norm": 0.1875, "learning_rate": 0.00019092501255163873, "loss": 0.6038323879241944, "mean_token_accuracy": 0.8356593985110521, "num_tokens": 5042620.0, "step": 940 }, { "entropy": 0.628834813600406, "epoch": 0.16458944678455026, "grad_norm": 0.140625, "learning_rate": 0.00019068998273405363, "loss": 0.611536693572998, "mean_token_accuracy": 0.8292743604630232, "num_tokens": 5095899.0, "step": 950 }, { "entropy": 0.6090147131122648, "epoch": 0.1663219672770192, "grad_norm": 0.216796875, "learning_rate": 0.00019045209669330747, "loss": 0.6397492408752441, "mean_token_accuracy": 0.8378318089991807, "num_tokens": 5145143.0, "step": 960 }, { "entropy": 0.6188279316294938, "epoch": 0.16805448776948814, "grad_norm": 0.2041015625, "learning_rate": 0.00019021136192146933, "loss": 0.6236711502075195, "mean_token_accuracy": 0.8312609314918518, "num_tokens": 5194365.0, "step": 970 }, { "entropy": 0.6223139866255224, "epoch": 0.1697870082619571, "grad_norm": 0.1533203125, "learning_rate": 0.00018996778600032733, "loss": 0.5912320137023925, "mean_token_accuracy": 0.8325776852667331, "num_tokens": 5249204.0, "step": 980 }, { "entropy": 0.6108009752351791, "epoch": 0.17151952875442605, "grad_norm": 0.2275390625, "learning_rate": 0.00018972137660114977, "loss": 0.6407642841339112, "mean_token_accuracy": 0.8345553431659937, "num_tokens": 5300027.0, "step": 990 }, { "entropy": 0.6413511738181115, "epoch": 0.173252049246895, "grad_norm": 0.2119140625, "learning_rate": 0.00018947214148444346, "loss": 0.6601122856140137, "mean_token_accuracy": 0.8267729926854372, "num_tokens": 5351314.0, "step": 1000 }, { "entropy": 0.6124841270968318, "epoch": 0.17498456973936394, "grad_norm": 0.1728515625, "learning_rate": 0.00018922008849970947, "loss": 0.6234911918640137, "mean_token_accuracy": 0.8351690549403429, "num_tokens": 5403143.0, "step": 1010 }, { "entropy": 0.5752321697305888, "epoch": 0.1767170902318329, "grad_norm": 0.1640625, "learning_rate": 0.00018896522558519574, "loss": 0.5731208801269532, "mean_token_accuracy": 0.8450708810240031, "num_tokens": 5452416.0, "step": 1020 }, { "entropy": 0.616970372479409, "epoch": 0.17844961072430185, "grad_norm": 0.158203125, "learning_rate": 0.00018870756076764725, "loss": 0.6389582633972168, "mean_token_accuracy": 0.8294888816773891, "num_tokens": 5507850.0, "step": 1030 }, { "entropy": 0.6209618886932731, "epoch": 0.1801821312167708, "grad_norm": 0.220703125, "learning_rate": 0.00018844710216205305, "loss": 0.5994563102722168, "mean_token_accuracy": 0.8357018873095512, "num_tokens": 5563755.0, "step": 1040 }, { "entropy": 0.5663943574763834, "epoch": 0.18191465170923976, "grad_norm": 0.173828125, "learning_rate": 0.00018818385797139082, "loss": 0.5874752044677735, "mean_token_accuracy": 0.8382753696292639, "num_tokens": 5615163.0, "step": 1050 }, { "entropy": 0.5496276264078915, "epoch": 0.1836471722017087, "grad_norm": 0.2080078125, "learning_rate": 0.00018791783648636844, "loss": 0.552100658416748, "mean_token_accuracy": 0.847124283015728, "num_tokens": 5666023.0, "step": 1060 }, { "entropy": 0.5882025823928416, "epoch": 0.18537969269417764, "grad_norm": 0.154296875, "learning_rate": 0.00018764904608516286, "loss": 0.5891311168670654, "mean_token_accuracy": 0.8424473576247692, "num_tokens": 5718586.0, "step": 1070 }, { "entropy": 0.5900297143496573, "epoch": 0.1871122131866466, "grad_norm": 0.193359375, "learning_rate": 0.00018737749523315634, "loss": 0.5772682189941406, "mean_token_accuracy": 0.8354586530476809, "num_tokens": 5773519.0, "step": 1080 }, { "entropy": 0.6208466733340174, "epoch": 0.18884473367911556, "grad_norm": 0.1806640625, "learning_rate": 0.0001871031924826698, "loss": 0.6123514652252198, "mean_token_accuracy": 0.8369224779307842, "num_tokens": 5826864.0, "step": 1090 }, { "entropy": 0.6265057612210512, "epoch": 0.1905772541715845, "grad_norm": 0.2216796875, "learning_rate": 0.00018682614647269337, "loss": 0.6527121067047119, "mean_token_accuracy": 0.8279910124838352, "num_tokens": 5883460.0, "step": 1100 }, { "entropy": 0.6124740152154118, "epoch": 0.19230977466405344, "grad_norm": 0.1865234375, "learning_rate": 0.00018654636592861442, "loss": 0.601304292678833, "mean_token_accuracy": 0.837521544471383, "num_tokens": 5935188.0, "step": 1110 }, { "entropy": 0.6669362563639879, "epoch": 0.1940422951565224, "grad_norm": 0.1669921875, "learning_rate": 0.00018626385966194275, "loss": 0.6994386196136475, "mean_token_accuracy": 0.8204180236905814, "num_tokens": 5990812.0, "step": 1120 }, { "entropy": 0.5861103215254844, "epoch": 0.19577481564899135, "grad_norm": 0.1455078125, "learning_rate": 0.00018597863657003301, "loss": 0.596555233001709, "mean_token_accuracy": 0.8415500700473786, "num_tokens": 6046076.0, "step": 1130 }, { "entropy": 0.574791920511052, "epoch": 0.1975073361414603, "grad_norm": 0.2392578125, "learning_rate": 0.00018569070563580464, "loss": 0.5656003952026367, "mean_token_accuracy": 0.84433070756495, "num_tokens": 6096184.0, "step": 1140 }, { "entropy": 0.5880047191400081, "epoch": 0.19923985663392924, "grad_norm": 0.1826171875, "learning_rate": 0.00018540007592745864, "loss": 0.6296281337738037, "mean_token_accuracy": 0.8372744925320148, "num_tokens": 6150146.0, "step": 1150 }, { "entropy": 0.6163527581840753, "epoch": 0.2009723771263982, "grad_norm": 0.22265625, "learning_rate": 0.0001851067565981924, "loss": 0.6186246395111084, "mean_token_accuracy": 0.8372070085257292, "num_tokens": 6204194.0, "step": 1160 }, { "entropy": 0.6072378985583782, "epoch": 0.20270489761886715, "grad_norm": 0.2109375, "learning_rate": 0.00018481075688591103, "loss": 0.6095839023590088, "mean_token_accuracy": 0.838889866694808, "num_tokens": 6258705.0, "step": 1170 }, { "entropy": 0.6074762488715351, "epoch": 0.2044374181113361, "grad_norm": 0.193359375, "learning_rate": 0.0001845120861129367, "loss": 0.5899257659912109, "mean_token_accuracy": 0.8360508769750595, "num_tokens": 6307059.0, "step": 1180 }, { "entropy": 0.641719778161496, "epoch": 0.20616993860380506, "grad_norm": 0.1865234375, "learning_rate": 0.00018421075368571494, "loss": 0.6559735298156738, "mean_token_accuracy": 0.8301095329225063, "num_tokens": 6358072.0, "step": 1190 }, { "entropy": 0.5920701253227889, "epoch": 0.207902459096274, "grad_norm": 0.1845703125, "learning_rate": 0.0001839067690945183, "loss": 0.6020590782165527, "mean_token_accuracy": 0.8376339256763459, "num_tokens": 6410083.0, "step": 1200 }, { "entropy": 0.6142618627287447, "epoch": 0.20963497958874294, "grad_norm": 0.2119140625, "learning_rate": 0.0001836001419131476, "loss": 0.6106932640075684, "mean_token_accuracy": 0.8338899418711663, "num_tokens": 6463508.0, "step": 1210 }, { "entropy": 0.6488701615482568, "epoch": 0.21136750008121188, "grad_norm": 0.1669921875, "learning_rate": 0.00018329088179863033, "loss": 0.6356019973754883, "mean_token_accuracy": 0.8337765200063586, "num_tokens": 6523476.0, "step": 1220 }, { "entropy": 0.6172928042709828, "epoch": 0.21310002057368085, "grad_norm": 0.1728515625, "learning_rate": 0.00018297899849091656, "loss": 0.6405450344085694, "mean_token_accuracy": 0.8321660306304693, "num_tokens": 6573355.0, "step": 1230 }, { "entropy": 0.621446970757097, "epoch": 0.2148325410661498, "grad_norm": 0.177734375, "learning_rate": 0.0001826645018125721, "loss": 0.6622963428497315, "mean_token_accuracy": 0.8254197046160698, "num_tokens": 6622895.0, "step": 1240 }, { "entropy": 0.6129778816364706, "epoch": 0.21656506155861874, "grad_norm": 0.16015625, "learning_rate": 0.00018234740166846929, "loss": 0.5634833335876465, "mean_token_accuracy": 0.8355090744793415, "num_tokens": 6679834.0, "step": 1250 }, { "entropy": 0.6156612957827747, "epoch": 0.2182975820510877, "grad_norm": 0.1640625, "learning_rate": 0.00018202770804547492, "loss": 0.6147466659545898, "mean_token_accuracy": 0.8310359807685017, "num_tokens": 6731484.0, "step": 1260 }, { "entropy": 0.5810929948464036, "epoch": 0.22003010254355665, "grad_norm": 0.189453125, "learning_rate": 0.00018170543101213565, "loss": 0.5630557537078857, "mean_token_accuracy": 0.8407821863889694, "num_tokens": 6787191.0, "step": 1270 }, { "entropy": 0.6104231233242899, "epoch": 0.2217626230360256, "grad_norm": 0.1943359375, "learning_rate": 0.00018138058071836115, "loss": 0.621036958694458, "mean_token_accuracy": 0.8329197008162736, "num_tokens": 6840606.0, "step": 1280 }, { "entropy": 0.6128938837908209, "epoch": 0.22349514352849456, "grad_norm": 0.21484375, "learning_rate": 0.00018105316739510424, "loss": 0.5915724754333496, "mean_token_accuracy": 0.8370759826153517, "num_tokens": 6887163.0, "step": 1290 }, { "entropy": 0.5851812950335443, "epoch": 0.2252276640209635, "grad_norm": 0.2236328125, "learning_rate": 0.00018072320135403862, "loss": 0.5940948963165283, "mean_token_accuracy": 0.8384971469640732, "num_tokens": 6940242.0, "step": 1300 }, { "entropy": 0.5889422579668462, "epoch": 0.22696018451343244, "grad_norm": 0.21875, "learning_rate": 0.00018039069298723435, "loss": 0.5769166946411133, "mean_token_accuracy": 0.8388250943273305, "num_tokens": 6996198.0, "step": 1310 }, { "entropy": 0.606858121138066, "epoch": 0.2286927050059014, "grad_norm": 0.1552734375, "learning_rate": 0.00018005565276683037, "loss": 0.6112150192260742, "mean_token_accuracy": 0.8364918135106564, "num_tokens": 7048115.0, "step": 1320 }, { "entropy": 0.5949655521195382, "epoch": 0.23042522549837036, "grad_norm": 0.2470703125, "learning_rate": 0.00017971809124470468, "loss": 0.6120047569274902, "mean_token_accuracy": 0.8407701279968023, "num_tokens": 7108085.0, "step": 1330 }, { "entropy": 0.6079389780759812, "epoch": 0.2321577459908393, "grad_norm": 0.16015625, "learning_rate": 0.00017937801905214214, "loss": 0.6000718593597412, "mean_token_accuracy": 0.8364381536841392, "num_tokens": 7162152.0, "step": 1340 }, { "entropy": 0.6189309723675251, "epoch": 0.23389026648330824, "grad_norm": 0.2275390625, "learning_rate": 0.00017903544689949953, "loss": 0.6147403240203857, "mean_token_accuracy": 0.8258390601724386, "num_tokens": 7213480.0, "step": 1350 }, { "entropy": 0.5935845918487758, "epoch": 0.2356227869757772, "grad_norm": 0.244140625, "learning_rate": 0.00017869038557586834, "loss": 0.594597339630127, "mean_token_accuracy": 0.8422905754297971, "num_tokens": 7268365.0, "step": 1360 }, { "entropy": 0.5886939469724893, "epoch": 0.23735530746824615, "grad_norm": 0.1796875, "learning_rate": 0.00017834284594873476, "loss": 0.5968518257141113, "mean_token_accuracy": 0.839365403354168, "num_tokens": 7322788.0, "step": 1370 }, { "entropy": 0.5890856982208789, "epoch": 0.2390878279607151, "grad_norm": 0.20703125, "learning_rate": 0.00017799283896363776, "loss": 0.5831431388854981, "mean_token_accuracy": 0.8419708486646413, "num_tokens": 7378087.0, "step": 1380 }, { "entropy": 0.6064389856532216, "epoch": 0.24082034845318404, "grad_norm": 0.26171875, "learning_rate": 0.00017764037564382408, "loss": 0.6195587635040283, "mean_token_accuracy": 0.8357837244868278, "num_tokens": 7432262.0, "step": 1390 }, { "entropy": 0.5797448608092963, "epoch": 0.242552868945653, "grad_norm": 0.1826171875, "learning_rate": 0.00017728546708990113, "loss": 0.6022681713104248, "mean_token_accuracy": 0.8418242033571005, "num_tokens": 7489537.0, "step": 1400 }, { "entropy": 0.585219320608303, "epoch": 0.24428538943812195, "grad_norm": 0.1494140625, "learning_rate": 0.0001769281244794875, "loss": 0.601930570602417, "mean_token_accuracy": 0.8405182551592588, "num_tokens": 7545283.0, "step": 1410 }, { "entropy": 0.6301440540701151, "epoch": 0.2460179099305909, "grad_norm": 0.16796875, "learning_rate": 0.0001765683590668607, "loss": 0.617746639251709, "mean_token_accuracy": 0.8311772037297487, "num_tokens": 7599954.0, "step": 1420 }, { "entropy": 0.5862551515456289, "epoch": 0.24775043042305986, "grad_norm": 0.1494140625, "learning_rate": 0.000176206182182603, "loss": 0.5854514122009278, "mean_token_accuracy": 0.8412911489605903, "num_tokens": 7651135.0, "step": 1430 }, { "entropy": 0.6006224121898412, "epoch": 0.2494829509155288, "grad_norm": 0.2451171875, "learning_rate": 0.00017584160523324437, "loss": 0.626686954498291, "mean_token_accuracy": 0.8344044268131257, "num_tokens": 7701714.0, "step": 1440 }, { "entropy": 0.6094549149740487, "epoch": 0.25121547140799777, "grad_norm": 0.220703125, "learning_rate": 0.00017547463970090323, "loss": 0.5837365627288819, "mean_token_accuracy": 0.8370290040969849, "num_tokens": 7755256.0, "step": 1450 }, { "entropy": 0.5964161755517126, "epoch": 0.2529479919004667, "grad_norm": 0.158203125, "learning_rate": 0.00017510529714292496, "loss": 0.5807624340057373, "mean_token_accuracy": 0.8389873761683703, "num_tokens": 7805875.0, "step": 1460 }, { "entropy": 0.5798287321813405, "epoch": 0.25468051239293565, "grad_norm": 0.177734375, "learning_rate": 0.0001747335891915179, "loss": 0.6037708759307862, "mean_token_accuracy": 0.8360363617539406, "num_tokens": 7857904.0, "step": 1470 }, { "entropy": 0.6185758833307773, "epoch": 0.2564130328854046, "grad_norm": 0.203125, "learning_rate": 0.00017435952755338684, "loss": 0.6310105323791504, "mean_token_accuracy": 0.8346008766442538, "num_tokens": 7911115.0, "step": 1480 }, { "entropy": 0.5521081209182739, "epoch": 0.25814555337787354, "grad_norm": 0.158203125, "learning_rate": 0.00017398312400936452, "loss": 0.5405902862548828, "mean_token_accuracy": 0.8503412056714297, "num_tokens": 7961113.0, "step": 1490 }, { "entropy": 0.6125838646665216, "epoch": 0.2598780738703425, "grad_norm": 0.224609375, "learning_rate": 0.00017360439041404045, "loss": 0.6419179439544678, "mean_token_accuracy": 0.831499756872654, "num_tokens": 8016836.0, "step": 1500 }, { "entropy": 0.6090016840025783, "epoch": 0.2616105943628114, "grad_norm": 0.16796875, "learning_rate": 0.0001732233386953877, "loss": 0.6156506061553955, "mean_token_accuracy": 0.8323286134749651, "num_tokens": 8069126.0, "step": 1510 }, { "entropy": 0.5781607817858457, "epoch": 0.2633431148552804, "grad_norm": 0.166015625, "learning_rate": 0.000172839980854387, "loss": 0.5711768627166748, "mean_token_accuracy": 0.8443056184798479, "num_tokens": 8121984.0, "step": 1520 }, { "entropy": 0.6185290202964098, "epoch": 0.26507563534774936, "grad_norm": 0.2177734375, "learning_rate": 0.0001724543289646491, "loss": 0.6232064247131348, "mean_token_accuracy": 0.8340055584907532, "num_tokens": 8174853.0, "step": 1530 }, { "entropy": 0.5681716504506766, "epoch": 0.2668081558402183, "grad_norm": 0.201171875, "learning_rate": 0.0001720663951720343, "loss": 0.5704017162322998, "mean_token_accuracy": 0.8463324144482612, "num_tokens": 8230103.0, "step": 1540 }, { "entropy": 0.6060013690497726, "epoch": 0.26854067633268724, "grad_norm": 0.203125, "learning_rate": 0.00017167619169426997, "loss": 0.6261486053466797, "mean_token_accuracy": 0.8349693570286035, "num_tokens": 8285159.0, "step": 1550 }, { "entropy": 0.5899374564178288, "epoch": 0.2702731968251562, "grad_norm": 0.1748046875, "learning_rate": 0.00017128373082056565, "loss": 0.5784136772155761, "mean_token_accuracy": 0.834688114002347, "num_tokens": 8339683.0, "step": 1560 }, { "entropy": 0.600262654479593, "epoch": 0.27200571731762513, "grad_norm": 0.232421875, "learning_rate": 0.00017088902491122637, "loss": 0.6100976943969727, "mean_token_accuracy": 0.8409205380827188, "num_tokens": 8392860.0, "step": 1570 }, { "entropy": 0.6050844821147621, "epoch": 0.2737382378100941, "grad_norm": 0.171875, "learning_rate": 0.0001704920863972629, "loss": 0.6370552539825439, "mean_token_accuracy": 0.833171795681119, "num_tokens": 8444381.0, "step": 1580 }, { "entropy": 0.622040162421763, "epoch": 0.27547075830256307, "grad_norm": 0.1572265625, "learning_rate": 0.00017009292778000056, "loss": 0.6550620555877685, "mean_token_accuracy": 0.8347457438707352, "num_tokens": 8500064.0, "step": 1590 }, { "entropy": 0.5820012846495957, "epoch": 0.277203278795032, "grad_norm": 0.1826171875, "learning_rate": 0.00016969156163068548, "loss": 0.5726365089416504, "mean_token_accuracy": 0.8414584957063198, "num_tokens": 8554413.0, "step": 1600 }, { "entropy": 0.6192501490004361, "epoch": 0.27893579928750095, "grad_norm": 0.240234375, "learning_rate": 0.0001692880005900884, "loss": 0.6141728401184082, "mean_token_accuracy": 0.8348658731207251, "num_tokens": 8608546.0, "step": 1610 }, { "entropy": 0.5944610396865755, "epoch": 0.2806683197799699, "grad_norm": 0.2001953125, "learning_rate": 0.00016888225736810702, "loss": 0.5792739868164063, "mean_token_accuracy": 0.8423636559396982, "num_tokens": 8661380.0, "step": 1620 }, { "entropy": 0.5956152304075658, "epoch": 0.28240084027243884, "grad_norm": 0.2099609375, "learning_rate": 0.00016847434474336528, "loss": 0.5970348358154297, "mean_token_accuracy": 0.8401257161051034, "num_tokens": 8709577.0, "step": 1630 }, { "entropy": 0.6147611321881413, "epoch": 0.2841333607649078, "grad_norm": 0.1884765625, "learning_rate": 0.00016806427556281106, "loss": 0.629329776763916, "mean_token_accuracy": 0.8385975230485201, "num_tokens": 8761040.0, "step": 1640 }, { "entropy": 0.6490127250086516, "epoch": 0.2858658812573768, "grad_norm": 0.2080078125, "learning_rate": 0.0001676520627413117, "loss": 0.6809987545013427, "mean_token_accuracy": 0.8295384451746941, "num_tokens": 8815974.0, "step": 1650 }, { "entropy": 0.5769906338769942, "epoch": 0.2875984017498457, "grad_norm": 0.181640625, "learning_rate": 0.00016723771926124706, "loss": 0.6031839847564697, "mean_token_accuracy": 0.8421449929475784, "num_tokens": 8864858.0, "step": 1660 }, { "entropy": 0.5643401111476123, "epoch": 0.28933092224231466, "grad_norm": 0.1650390625, "learning_rate": 0.0001668212581721008, "loss": 0.5524356365203857, "mean_token_accuracy": 0.8459334097802639, "num_tokens": 8917743.0, "step": 1670 }, { "entropy": 0.5941579655511304, "epoch": 0.2910634427347836, "grad_norm": 0.1484375, "learning_rate": 0.0001664026925900492, "loss": 0.6215604782104492, "mean_token_accuracy": 0.8360832681879401, "num_tokens": 8974177.0, "step": 1680 }, { "entropy": 0.6097073512617499, "epoch": 0.29279596322725254, "grad_norm": 0.1953125, "learning_rate": 0.00016598203569754842, "loss": 0.6148754119873047, "mean_token_accuracy": 0.8349464479833841, "num_tokens": 9029784.0, "step": 1690 }, { "entropy": 0.5949376497417689, "epoch": 0.2945284837197215, "grad_norm": 0.171875, "learning_rate": 0.00016555930074291892, "loss": 0.5629282474517823, "mean_token_accuracy": 0.8412305314093829, "num_tokens": 9086247.0, "step": 1700 }, { "entropy": 0.6209503551013767, "epoch": 0.2962610042121904, "grad_norm": 0.1728515625, "learning_rate": 0.00016513450103992843, "loss": 0.6351428508758545, "mean_token_accuracy": 0.8299500808119774, "num_tokens": 9139348.0, "step": 1710 }, { "entropy": 0.6122556574642658, "epoch": 0.2979935247046594, "grad_norm": 0.259765625, "learning_rate": 0.0001647076499673727, "loss": 0.6054322719573975, "mean_token_accuracy": 0.8361066952347755, "num_tokens": 9189774.0, "step": 1720 }, { "entropy": 0.6057383619248867, "epoch": 0.29972604519712837, "grad_norm": 0.166015625, "learning_rate": 0.00016427876096865394, "loss": 0.5783013820648193, "mean_token_accuracy": 0.8409923903644085, "num_tokens": 9247091.0, "step": 1730 }, { "entropy": 0.6327047647442668, "epoch": 0.3014585656895973, "grad_norm": 0.1708984375, "learning_rate": 0.00016384784755135766, "loss": 0.6669343471527099, "mean_token_accuracy": 0.8293208103626967, "num_tokens": 9302230.0, "step": 1740 }, { "entropy": 0.5699484588578343, "epoch": 0.30319108618206625, "grad_norm": 0.2119140625, "learning_rate": 0.00016341492328682703, "loss": 0.5571082592010498, "mean_token_accuracy": 0.8480747263878584, "num_tokens": 9356728.0, "step": 1750 }, { "entropy": 0.567579479701817, "epoch": 0.3049236066745352, "grad_norm": 0.1962890625, "learning_rate": 0.00016298000180973573, "loss": 0.5580705165863037, "mean_token_accuracy": 0.8437619034200907, "num_tokens": 9408140.0, "step": 1760 }, { "entropy": 0.5828627380309627, "epoch": 0.30665612716700413, "grad_norm": 0.18359375, "learning_rate": 0.00016254309681765813, "loss": 0.5716603755950928, "mean_token_accuracy": 0.8377308517694473, "num_tokens": 9467463.0, "step": 1770 }, { "entropy": 0.5848529391689226, "epoch": 0.3083886476594731, "grad_norm": 0.158203125, "learning_rate": 0.0001621042220706384, "loss": 0.5793115139007569, "mean_token_accuracy": 0.8402173619717359, "num_tokens": 9522306.0, "step": 1780 }, { "entropy": 0.6066678614355624, "epoch": 0.3101211681519421, "grad_norm": 0.1591796875, "learning_rate": 0.00016166339139075676, "loss": 0.6328657627105713, "mean_token_accuracy": 0.8367021255195141, "num_tokens": 9572434.0, "step": 1790 }, { "entropy": 0.6003833622671664, "epoch": 0.311853688644411, "grad_norm": 0.2119140625, "learning_rate": 0.0001612206186616942, "loss": 0.6137086391448975, "mean_token_accuracy": 0.8334165547043085, "num_tokens": 9628519.0, "step": 1800 }, { "entropy": 0.590199672896415, "epoch": 0.31358620913687996, "grad_norm": 0.185546875, "learning_rate": 0.00016077591782829548, "loss": 0.5786579608917236, "mean_token_accuracy": 0.8455715507268906, "num_tokens": 9681885.0, "step": 1810 }, { "entropy": 0.5942349970573559, "epoch": 0.31531872962934887, "grad_norm": 0.203125, "learning_rate": 0.00016032930289612972, "loss": 0.603551721572876, "mean_token_accuracy": 0.8380775325000286, "num_tokens": 9731757.0, "step": 1820 }, { "entropy": 0.6340034159831702, "epoch": 0.31705125012181784, "grad_norm": 0.2255859375, "learning_rate": 0.0001598807879310493, "loss": 0.6752604007720947, "mean_token_accuracy": 0.8293415606021881, "num_tokens": 9784377.0, "step": 1830 }, { "entropy": 0.6373454562388361, "epoch": 0.3187837706142868, "grad_norm": 0.1728515625, "learning_rate": 0.000159430387058747, "loss": 0.6538397312164307, "mean_token_accuracy": 0.8350980304181576, "num_tokens": 9834147.0, "step": 1840 }, { "entropy": 0.5898376687895507, "epoch": 0.3205162911067557, "grad_norm": 0.1767578125, "learning_rate": 0.00015897811446431094, "loss": 0.5761978149414062, "mean_token_accuracy": 0.8405380714684725, "num_tokens": 9886125.0, "step": 1850 }, { "entropy": 0.6033100615255534, "epoch": 0.3222488115992247, "grad_norm": 0.1953125, "learning_rate": 0.00015852398439177812, "loss": 0.6355989933013916, "mean_token_accuracy": 0.8382335666567087, "num_tokens": 9938648.0, "step": 1860 }, { "entropy": 0.5812505614478141, "epoch": 0.32398133209169366, "grad_norm": 0.1689453125, "learning_rate": 0.00015806801114368543, "loss": 0.6040312290191651, "mean_token_accuracy": 0.8389291629195214, "num_tokens": 9990548.0, "step": 1870 }, { "entropy": 0.5965979805681855, "epoch": 0.3257138525841626, "grad_norm": 0.22265625, "learning_rate": 0.00015761020908061947, "loss": 0.6084609985351562, "mean_token_accuracy": 0.8397494804114103, "num_tokens": 10043712.0, "step": 1880 }, { "entropy": 0.6055567375849933, "epoch": 0.32744637307663155, "grad_norm": 0.2119140625, "learning_rate": 0.0001571505926207643, "loss": 0.5824664115905762, "mean_token_accuracy": 0.8369629330933094, "num_tokens": 10098633.0, "step": 1890 }, { "entropy": 0.622294892789796, "epoch": 0.3291788935691005, "grad_norm": 0.29296875, "learning_rate": 0.0001566891762394471, "loss": 0.6370018005371094, "mean_token_accuracy": 0.8303959008306265, "num_tokens": 10152668.0, "step": 1900 }, { "entropy": 0.6205999419093132, "epoch": 0.33091141406156943, "grad_norm": 0.1826171875, "learning_rate": 0.00015622597446868252, "loss": 0.6031853199005127, "mean_token_accuracy": 0.839716836810112, "num_tokens": 10203981.0, "step": 1910 }, { "entropy": 0.5835219689644873, "epoch": 0.3326439345540384, "grad_norm": 0.2099609375, "learning_rate": 0.00015576100189671488, "loss": 0.583237886428833, "mean_token_accuracy": 0.8391559388488531, "num_tokens": 10256722.0, "step": 1920 }, { "entropy": 0.5798515821807086, "epoch": 0.33437645504650737, "grad_norm": 0.1630859375, "learning_rate": 0.00015529427316755874, "loss": 0.621484899520874, "mean_token_accuracy": 0.8355384927242995, "num_tokens": 10310185.0, "step": 1930 }, { "entropy": 0.5843613225501031, "epoch": 0.3361089755389763, "grad_norm": 0.236328125, "learning_rate": 0.00015482580298053778, "loss": 0.6080245018005371, "mean_token_accuracy": 0.842098330333829, "num_tokens": 10365812.0, "step": 1940 }, { "entropy": 0.5864246059209108, "epoch": 0.33784149603144525, "grad_norm": 0.228515625, "learning_rate": 0.00015435560608982168, "loss": 0.5887944221496582, "mean_token_accuracy": 0.8388173773884773, "num_tokens": 10420413.0, "step": 1950 }, { "entropy": 0.5741982539650052, "epoch": 0.3395740165239142, "grad_norm": 0.171875, "learning_rate": 0.0001538836973039616, "loss": 0.5880287647247314, "mean_token_accuracy": 0.8398171707987785, "num_tokens": 10477056.0, "step": 1960 }, { "entropy": 0.6004749670159072, "epoch": 0.34130653701638314, "grad_norm": 0.201171875, "learning_rate": 0.00015341009148542377, "loss": 0.619431734085083, "mean_token_accuracy": 0.8380085773766041, "num_tokens": 10530758.0, "step": 1970 }, { "entropy": 0.5911483001895249, "epoch": 0.3430390575088521, "grad_norm": 0.216796875, "learning_rate": 0.00015293480355012138, "loss": 0.5825908660888672, "mean_token_accuracy": 0.8379138492047786, "num_tokens": 10586548.0, "step": 1980 }, { "entropy": 0.5724553103093057, "epoch": 0.344771578001321, "grad_norm": 0.1640625, "learning_rate": 0.0001524578484669448, "loss": 0.5837036609649658, "mean_token_accuracy": 0.8414458900690078, "num_tokens": 10640208.0, "step": 1990 }, { "entropy": 0.5913511055056005, "epoch": 0.34650409849379, "grad_norm": 0.2294921875, "learning_rate": 0.00015197924125729016, "loss": 0.6037324905395508, "mean_token_accuracy": 0.8375172037631273, "num_tokens": 10689070.0, "step": 2000 }, { "entropy": 0.5623359635006636, "epoch": 0.34823661898625896, "grad_norm": 0.26171875, "learning_rate": 0.0001514989969945862, "loss": 0.5799863815307618, "mean_token_accuracy": 0.8434689830988645, "num_tokens": 10741791.0, "step": 2010 }, { "entropy": 0.595218509202823, "epoch": 0.3499691394787279, "grad_norm": 0.2021484375, "learning_rate": 0.0001510171308038197, "loss": 0.5759833335876465, "mean_token_accuracy": 0.8378583282232285, "num_tokens": 10792017.0, "step": 2020 }, { "entropy": 0.5926129624480382, "epoch": 0.35170165997119684, "grad_norm": 0.275390625, "learning_rate": 0.00015053365786105898, "loss": 0.6137632369995117, "mean_token_accuracy": 0.8360541388392448, "num_tokens": 10841822.0, "step": 2030 }, { "entropy": 0.588808442093432, "epoch": 0.3534341804636658, "grad_norm": 0.1669921875, "learning_rate": 0.00015004859339297602, "loss": 0.6234822750091553, "mean_token_accuracy": 0.8365503929555416, "num_tokens": 10895402.0, "step": 2040 }, { "entropy": 0.6277590793790295, "epoch": 0.35516670095613473, "grad_norm": 0.171875, "learning_rate": 0.0001495619526763668, "loss": 0.6404668807983398, "mean_token_accuracy": 0.8322111006826163, "num_tokens": 10948926.0, "step": 2050 }, { "entropy": 0.5735611078329385, "epoch": 0.3568992214486037, "grad_norm": 0.2138671875, "learning_rate": 0.00014907375103767037, "loss": 0.554630708694458, "mean_token_accuracy": 0.8440061457455158, "num_tokens": 11001006.0, "step": 2060 }, { "entropy": 0.582486811466515, "epoch": 0.35863174194107267, "grad_norm": 0.26171875, "learning_rate": 0.00014858400385248585, "loss": 0.565306568145752, "mean_token_accuracy": 0.8428201846778393, "num_tokens": 11057715.0, "step": 2070 }, { "entropy": 0.5820039538666606, "epoch": 0.3603642624335416, "grad_norm": 0.259765625, "learning_rate": 0.00014809272654508855, "loss": 0.5647046089172363, "mean_token_accuracy": 0.8435172945261001, "num_tokens": 11105950.0, "step": 2080 }, { "entropy": 0.6123531493823975, "epoch": 0.36209678292601055, "grad_norm": 0.18359375, "learning_rate": 0.00014759993458794387, "loss": 0.6230340003967285, "mean_token_accuracy": 0.8300592731684446, "num_tokens": 11159753.0, "step": 2090 }, { "entropy": 0.586882522655651, "epoch": 0.3638293034184795, "grad_norm": 0.2119140625, "learning_rate": 0.00014710564350122021, "loss": 0.5888068199157714, "mean_token_accuracy": 0.8437575984746217, "num_tokens": 11217212.0, "step": 2100 }, { "entropy": 0.5973215179517866, "epoch": 0.36556182391094844, "grad_norm": 0.19921875, "learning_rate": 0.00014660986885230002, "loss": 0.6102025032043457, "mean_token_accuracy": 0.8387055590748786, "num_tokens": 11269879.0, "step": 2110 }, { "entropy": 0.5769942476414144, "epoch": 0.3672943444034174, "grad_norm": 0.2392578125, "learning_rate": 0.0001461126262552897, "loss": 0.577931547164917, "mean_token_accuracy": 0.8404097493737936, "num_tokens": 11319324.0, "step": 2120 }, { "entropy": 0.6094427598174661, "epoch": 0.3690268648958863, "grad_norm": 0.140625, "learning_rate": 0.00014561393137052766, "loss": 0.6362490653991699, "mean_token_accuracy": 0.8333139736205339, "num_tokens": 11375159.0, "step": 2130 }, { "entropy": 0.5666341712232679, "epoch": 0.3707593853883553, "grad_norm": 0.216796875, "learning_rate": 0.00014511379990409117, "loss": 0.567043685913086, "mean_token_accuracy": 0.8457438841462135, "num_tokens": 11426520.0, "step": 2140 }, { "entropy": 0.6225775457452982, "epoch": 0.37249190588082426, "grad_norm": 0.2216796875, "learning_rate": 0.00014461224760730187, "loss": 0.6647164821624756, "mean_token_accuracy": 0.8330285247415304, "num_tokens": 11484237.0, "step": 2150 }, { "entropy": 0.6187613100279122, "epoch": 0.3742244263732932, "grad_norm": 0.2314453125, "learning_rate": 0.00014410929027622934, "loss": 0.6382776260375976, "mean_token_accuracy": 0.8337401654571295, "num_tokens": 11536870.0, "step": 2160 }, { "entropy": 0.6030611063353717, "epoch": 0.37595694686576214, "grad_norm": 0.1806640625, "learning_rate": 0.00014360494375119395, "loss": 0.5975234508514404, "mean_token_accuracy": 0.8363439656794072, "num_tokens": 11584488.0, "step": 2170 }, { "entropy": 0.6093014625832438, "epoch": 0.3776894673582311, "grad_norm": 0.240234375, "learning_rate": 0.00014309922391626784, "loss": 0.6156137943267822, "mean_token_accuracy": 0.8362408101558685, "num_tokens": 11639837.0, "step": 2180 }, { "entropy": 0.6037656621308998, "epoch": 0.3794219878507, "grad_norm": 0.24609375, "learning_rate": 0.0001425921466987746, "loss": 0.5895677089691163, "mean_token_accuracy": 0.8392930574715137, "num_tokens": 11691666.0, "step": 2190 }, { "entropy": 0.5695399052929133, "epoch": 0.381154508343169, "grad_norm": 0.181640625, "learning_rate": 0.00014208372806878784, "loss": 0.5762203693389892, "mean_token_accuracy": 0.8463476520031691, "num_tokens": 11744574.0, "step": 2200 }, { "entropy": 0.5971330104395747, "epoch": 0.38288702883563797, "grad_norm": 0.212890625, "learning_rate": 0.00014157398403862793, "loss": 0.610533332824707, "mean_token_accuracy": 0.8361469194293022, "num_tokens": 11803183.0, "step": 2210 }, { "entropy": 0.6277089732699096, "epoch": 0.3846195493281069, "grad_norm": 0.171875, "learning_rate": 0.00014106293066235806, "loss": 0.6349636077880859, "mean_token_accuracy": 0.8273304011672735, "num_tokens": 11853042.0, "step": 2220 }, { "entropy": 0.6195264323614538, "epoch": 0.38635206982057585, "grad_norm": 0.17578125, "learning_rate": 0.00014055058403527828, "loss": 0.6387957572937012, "mean_token_accuracy": 0.8352078393101692, "num_tokens": 11907577.0, "step": 2230 }, { "entropy": 0.5621367298997939, "epoch": 0.3880845903130448, "grad_norm": 0.27734375, "learning_rate": 0.00014003696029341885, "loss": 0.5445407390594482, "mean_token_accuracy": 0.8438704308122397, "num_tokens": 11964072.0, "step": 2240 }, { "entropy": 0.5822187520563602, "epoch": 0.38981711080551373, "grad_norm": 0.1904296875, "learning_rate": 0.00013952207561303186, "loss": 0.5968410491943359, "mean_token_accuracy": 0.8352361563593149, "num_tokens": 12018364.0, "step": 2250 }, { "entropy": 0.5926231760531664, "epoch": 0.3915496312979827, "grad_norm": 0.1845703125, "learning_rate": 0.000139005946210082, "loss": 0.5886177539825439, "mean_token_accuracy": 0.8381821203976869, "num_tokens": 12071181.0, "step": 2260 }, { "entropy": 0.6001140361186117, "epoch": 0.3932821517904517, "grad_norm": 0.1796875, "learning_rate": 0.00013848858833973555, "loss": 0.5883821487426758, "mean_token_accuracy": 0.8341061566025019, "num_tokens": 12123527.0, "step": 2270 }, { "entropy": 0.6000702895224095, "epoch": 0.3950146722829206, "grad_norm": 0.2470703125, "learning_rate": 0.00013797001829584868, "loss": 0.6160523891448975, "mean_token_accuracy": 0.8381300024688244, "num_tokens": 12179785.0, "step": 2280 }, { "entropy": 0.5846447445452213, "epoch": 0.39674719277538956, "grad_norm": 0.2041015625, "learning_rate": 0.00013745025241045412, "loss": 0.5964017868041992, "mean_token_accuracy": 0.840913362056017, "num_tokens": 12233504.0, "step": 2290 }, { "entropy": 0.5862786662764847, "epoch": 0.39847971326785847, "grad_norm": 0.205078125, "learning_rate": 0.00013692930705324697, "loss": 0.607056713104248, "mean_token_accuracy": 0.8370703462511301, "num_tokens": 12289939.0, "step": 2300 }, { "entropy": 0.6146723322104662, "epoch": 0.40021223376032744, "grad_norm": 0.1708984375, "learning_rate": 0.00013640719863106888, "loss": 0.6222431182861328, "mean_token_accuracy": 0.8339255709201098, "num_tokens": 12344232.0, "step": 2310 }, { "entropy": 0.6121346159372478, "epoch": 0.4019447542527964, "grad_norm": 0.201171875, "learning_rate": 0.00013588394358739168, "loss": 0.6056359291076661, "mean_token_accuracy": 0.8359162289649248, "num_tokens": 12395354.0, "step": 2320 }, { "entropy": 0.5537781528197229, "epoch": 0.4036772747452653, "grad_norm": 0.205078125, "learning_rate": 0.00013535955840179918, "loss": 0.5524442195892334, "mean_token_accuracy": 0.8491223704069852, "num_tokens": 12443486.0, "step": 2330 }, { "entropy": 0.5908654337283223, "epoch": 0.4054097952377343, "grad_norm": 0.1748046875, "learning_rate": 0.0001348340595894683, "loss": 0.6637831211090088, "mean_token_accuracy": 0.8352008298039436, "num_tokens": 12498278.0, "step": 2340 }, { "entropy": 0.6369602079503238, "epoch": 0.40714231573020326, "grad_norm": 0.2216796875, "learning_rate": 0.00013430746370064905, "loss": 0.6277615070343018, "mean_token_accuracy": 0.830039632320404, "num_tokens": 12548979.0, "step": 2350 }, { "entropy": 0.5778507422655821, "epoch": 0.4088748362226722, "grad_norm": 0.248046875, "learning_rate": 0.00013377978732014297, "loss": 0.5777788162231445, "mean_token_accuracy": 0.8472949586808681, "num_tokens": 12600361.0, "step": 2360 }, { "entropy": 0.6153424762189388, "epoch": 0.41060735671514115, "grad_norm": 0.177734375, "learning_rate": 0.00013325104706678117, "loss": 0.6212099552154541, "mean_token_accuracy": 0.8323879513889552, "num_tokens": 12650080.0, "step": 2370 }, { "entropy": 0.5499768436653539, "epoch": 0.4123398772076101, "grad_norm": 0.205078125, "learning_rate": 0.0001327212595929006, "loss": 0.556803035736084, "mean_token_accuracy": 0.8466630782932043, "num_tokens": 12707694.0, "step": 2380 }, { "entropy": 0.5946451628580689, "epoch": 0.41407239770007903, "grad_norm": 0.1787109375, "learning_rate": 0.00013219044158381988, "loss": 0.6023283004760742, "mean_token_accuracy": 0.8404143087565898, "num_tokens": 12763899.0, "step": 2390 }, { "entropy": 0.5769397917203605, "epoch": 0.415804918192548, "grad_norm": 0.1728515625, "learning_rate": 0.00013165860975731364, "loss": 0.5805276393890381, "mean_token_accuracy": 0.8394303295761347, "num_tokens": 12816977.0, "step": 2400 }, { "entropy": 0.6263184855692089, "epoch": 0.41753743868501697, "grad_norm": 0.201171875, "learning_rate": 0.00013112578086308603, "loss": 0.6258736610412597, "mean_token_accuracy": 0.8292172599583865, "num_tokens": 12867177.0, "step": 2410 }, { "entropy": 0.5767630891874432, "epoch": 0.4192699591774859, "grad_norm": 0.21875, "learning_rate": 0.0001305919716822432, "loss": 0.5918225765228271, "mean_token_accuracy": 0.8412780135869979, "num_tokens": 12921784.0, "step": 2420 }, { "entropy": 0.5780319124925881, "epoch": 0.42100247966995485, "grad_norm": 0.2060546875, "learning_rate": 0.00013005719902676484, "loss": 0.5864857196807861, "mean_token_accuracy": 0.8374421495944262, "num_tokens": 12974494.0, "step": 2430 }, { "entropy": 0.5848251041024923, "epoch": 0.42273500016242377, "grad_norm": 0.1787109375, "learning_rate": 0.00012952147973897463, "loss": 0.5625586032867431, "mean_token_accuracy": 0.8452736441045999, "num_tokens": 13029741.0, "step": 2440 }, { "entropy": 0.5782041396014392, "epoch": 0.42446752065489274, "grad_norm": 0.197265625, "learning_rate": 0.0001289848306910098, "loss": 0.5688180923461914, "mean_token_accuracy": 0.842210229113698, "num_tokens": 13082150.0, "step": 2450 }, { "entropy": 0.5863951063714922, "epoch": 0.4262000411473617, "grad_norm": 0.177734375, "learning_rate": 0.00012844726878428992, "loss": 0.5963150501251221, "mean_token_accuracy": 0.8403796773403883, "num_tokens": 13137759.0, "step": 2460 }, { "entropy": 0.5558338332921267, "epoch": 0.4279325616398306, "grad_norm": 0.21484375, "learning_rate": 0.00012790881094898427, "loss": 0.5558866024017334, "mean_token_accuracy": 0.8459072947502136, "num_tokens": 13192630.0, "step": 2470 }, { "entropy": 0.546316223940812, "epoch": 0.4296650821322996, "grad_norm": 0.203125, "learning_rate": 0.000127369474143479, "loss": 0.5630002975463867, "mean_token_accuracy": 0.8511018488556147, "num_tokens": 13247752.0, "step": 2480 }, { "entropy": 0.5771075886674225, "epoch": 0.43139760262476856, "grad_norm": 0.1669921875, "learning_rate": 0.00012682927535384272, "loss": 0.5783199310302735, "mean_token_accuracy": 0.8392299171537161, "num_tokens": 13301263.0, "step": 2490 }, { "entropy": 0.6328532771673053, "epoch": 0.4331301231172375, "grad_norm": 0.1552734375, "learning_rate": 0.0001262882315932918, "loss": 0.6653527736663818, "mean_token_accuracy": 0.8329028349369765, "num_tokens": 13355347.0, "step": 2500 }, { "entropy": 0.5985511194681749, "epoch": 0.43486264360970645, "grad_norm": 0.2421875, "learning_rate": 0.0001257463599016544, "loss": 0.6060856342315674, "mean_token_accuracy": 0.8381591210141778, "num_tokens": 13410328.0, "step": 2510 }, { "entropy": 0.6097901756409556, "epoch": 0.4365951641021754, "grad_norm": 0.1689453125, "learning_rate": 0.00012520367734483376, "loss": 0.5944780826568603, "mean_token_accuracy": 0.8347636796534061, "num_tokens": 13458141.0, "step": 2520 }, { "entropy": 0.5965319158509373, "epoch": 0.43832768459464433, "grad_norm": 0.162109375, "learning_rate": 0.00012466020101427092, "loss": 0.6008960247039795, "mean_token_accuracy": 0.8366463247686624, "num_tokens": 13516437.0, "step": 2530 }, { "entropy": 0.6449747297912836, "epoch": 0.4400602050871133, "grad_norm": 0.27734375, "learning_rate": 0.0001241159480264062, "loss": 0.6599147319793701, "mean_token_accuracy": 0.8267238955944777, "num_tokens": 13565792.0, "step": 2540 }, { "entropy": 0.601561525510624, "epoch": 0.44179272557958227, "grad_norm": 0.177734375, "learning_rate": 0.00012357093552214042, "loss": 0.6049664974212646, "mean_token_accuracy": 0.8392731335014105, "num_tokens": 13622412.0, "step": 2550 }, { "entropy": 0.5839989837259054, "epoch": 0.4435252460720512, "grad_norm": 0.193359375, "learning_rate": 0.00012302518066629466, "loss": 0.5930441379547119, "mean_token_accuracy": 0.8389767237007618, "num_tokens": 13676864.0, "step": 2560 }, { "entropy": 0.5947200076654553, "epoch": 0.44525776656452015, "grad_norm": 0.1943359375, "learning_rate": 0.0001224787006470701, "loss": 0.632440710067749, "mean_token_accuracy": 0.8404598146677017, "num_tokens": 13739726.0, "step": 2570 }, { "entropy": 0.5818848529364914, "epoch": 0.4469902870569891, "grad_norm": 0.16796875, "learning_rate": 0.0001219315126755063, "loss": 0.5822898387908936, "mean_token_accuracy": 0.8407908231019974, "num_tokens": 13793872.0, "step": 2580 }, { "entropy": 0.5871871233917773, "epoch": 0.44872280754945804, "grad_norm": 0.2275390625, "learning_rate": 0.00012138363398493946, "loss": 0.5781790733337402, "mean_token_accuracy": 0.8415582459419966, "num_tokens": 13845952.0, "step": 2590 }, { "entropy": 0.5868519256589935, "epoch": 0.450455328041927, "grad_norm": 0.2138671875, "learning_rate": 0.00012083508183045946, "loss": 0.5890952587127686, "mean_token_accuracy": 0.8406406987458468, "num_tokens": 13900081.0, "step": 2600 }, { "entropy": 0.5717327733058483, "epoch": 0.4521878485343959, "grad_norm": 0.1982421875, "learning_rate": 0.00012028587348836654, "loss": 0.5796187400817872, "mean_token_accuracy": 0.8397781111299991, "num_tokens": 13952949.0, "step": 2610 }, { "entropy": 0.582226577727124, "epoch": 0.4539203690268649, "grad_norm": 0.1953125, "learning_rate": 0.00011973602625562711, "loss": 0.6070287704467774, "mean_token_accuracy": 0.8392535090446472, "num_tokens": 14004724.0, "step": 2620 }, { "entropy": 0.5673700920306146, "epoch": 0.45565288951933386, "grad_norm": 0.2412109375, "learning_rate": 0.00011918555744932904, "loss": 0.5730877876281738, "mean_token_accuracy": 0.8469384342432023, "num_tokens": 14062688.0, "step": 2630 }, { "entropy": 0.5877885912545026, "epoch": 0.4573854100118028, "grad_norm": 0.2041015625, "learning_rate": 0.00011863448440613634, "loss": 0.5773820877075195, "mean_token_accuracy": 0.839915756508708, "num_tokens": 14113953.0, "step": 2640 }, { "entropy": 0.5963851167354732, "epoch": 0.45911793050427174, "grad_norm": 0.2060546875, "learning_rate": 0.00011808282448174295, "loss": 0.5954080104827881, "mean_token_accuracy": 0.8391872305423022, "num_tokens": 14165410.0, "step": 2650 }, { "entropy": 0.5849010232836008, "epoch": 0.4608504509967407, "grad_norm": 0.2177734375, "learning_rate": 0.00011753059505032635, "loss": 0.6184982776641845, "mean_token_accuracy": 0.8388860560953617, "num_tokens": 14219014.0, "step": 2660 }, { "entropy": 0.6050059227272868, "epoch": 0.4625829714892096, "grad_norm": 0.19921875, "learning_rate": 0.00011697781350400025, "loss": 0.5937928199768067, "mean_token_accuracy": 0.8371570736169816, "num_tokens": 14277983.0, "step": 2670 }, { "entropy": 0.55124610546045, "epoch": 0.4643154919816786, "grad_norm": 0.1728515625, "learning_rate": 0.00011642449725226685, "loss": 0.5754414081573487, "mean_token_accuracy": 0.8441458832472563, "num_tokens": 14334686.0, "step": 2680 }, { "entropy": 0.6277578006032855, "epoch": 0.46604801247414757, "grad_norm": 0.2578125, "learning_rate": 0.00011587066372146861, "loss": 0.6408638000488281, "mean_token_accuracy": 0.8318171612918377, "num_tokens": 14386998.0, "step": 2690 }, { "entropy": 0.5673693493008614, "epoch": 0.4677805329666165, "grad_norm": 0.1806640625, "learning_rate": 0.0001153163303542393, "loss": 0.5812714576721192, "mean_token_accuracy": 0.8425166368484497, "num_tokens": 14445548.0, "step": 2700 }, { "entropy": 0.613515446241945, "epoch": 0.46951305345908545, "grad_norm": 0.166015625, "learning_rate": 0.00011476151460895477, "loss": 0.6238789081573486, "mean_token_accuracy": 0.8347268708050251, "num_tokens": 14494120.0, "step": 2710 }, { "entropy": 0.6357726425863802, "epoch": 0.4712455739515544, "grad_norm": 0.1748046875, "learning_rate": 0.00011420623395918297, "loss": 0.6014580249786377, "mean_token_accuracy": 0.8301781140267849, "num_tokens": 14548742.0, "step": 2720 }, { "entropy": 0.5693127868697048, "epoch": 0.47297809444402333, "grad_norm": 0.208984375, "learning_rate": 0.00011365050589313391, "loss": 0.5637072563171387, "mean_token_accuracy": 0.8451267022639513, "num_tokens": 14600515.0, "step": 2730 }, { "entropy": 0.5784962127916515, "epoch": 0.4747106149364923, "grad_norm": 0.1533203125, "learning_rate": 0.00011309434791310846, "loss": 0.5662568092346192, "mean_token_accuracy": 0.8453169971704483, "num_tokens": 14652098.0, "step": 2740 }, { "entropy": 0.5996901510283351, "epoch": 0.4764431354289613, "grad_norm": 0.1669921875, "learning_rate": 0.00011253777753494752, "loss": 0.5977088928222656, "mean_token_accuracy": 0.837460282444954, "num_tokens": 14705588.0, "step": 2750 }, { "entropy": 0.5490922763012349, "epoch": 0.4781756559214302, "grad_norm": 0.19921875, "learning_rate": 0.00011198081228748013, "loss": 0.5457263946533203, "mean_token_accuracy": 0.8470884084701538, "num_tokens": 14753632.0, "step": 2760 }, { "entropy": 0.572597084986046, "epoch": 0.47990817641389916, "grad_norm": 0.2421875, "learning_rate": 0.0001114234697119715, "loss": 0.549776268005371, "mean_token_accuracy": 0.8426673550158739, "num_tokens": 14804928.0, "step": 2770 }, { "entropy": 0.5902726739645004, "epoch": 0.48164069690636807, "grad_norm": 0.1806640625, "learning_rate": 0.0001108657673615706, "loss": 0.6166749000549316, "mean_token_accuracy": 0.8378476161509752, "num_tokens": 14854574.0, "step": 2780 }, { "entropy": 0.5925680194981396, "epoch": 0.48337321739883704, "grad_norm": 0.2080078125, "learning_rate": 0.00011030772280075714, "loss": 0.5907174587249756, "mean_token_accuracy": 0.8409414291381836, "num_tokens": 14906122.0, "step": 2790 }, { "entropy": 0.6074271734803915, "epoch": 0.485105737891306, "grad_norm": 0.2353515625, "learning_rate": 0.00010974935360478876, "loss": 0.6153085708618165, "mean_token_accuracy": 0.8358694747090339, "num_tokens": 14959790.0, "step": 2800 }, { "entropy": 0.5647475293837487, "epoch": 0.4868382583837749, "grad_norm": 0.166015625, "learning_rate": 0.00010919067735914699, "loss": 0.5801798820495605, "mean_token_accuracy": 0.8441315289586783, "num_tokens": 15015091.0, "step": 2810 }, { "entropy": 0.5615489536430687, "epoch": 0.4885707788762439, "grad_norm": 0.2080078125, "learning_rate": 0.00010863171165898398, "loss": 0.5529567241668701, "mean_token_accuracy": 0.8446899481117726, "num_tokens": 15063799.0, "step": 2820 }, { "entropy": 0.587787312315777, "epoch": 0.49030329936871286, "grad_norm": 0.2001953125, "learning_rate": 0.00010807247410856783, "loss": 0.5839251518249512, "mean_token_accuracy": 0.8386691033840179, "num_tokens": 15118840.0, "step": 2830 }, { "entropy": 0.6014495314564556, "epoch": 0.4920358198611818, "grad_norm": 0.212890625, "learning_rate": 0.00010751298232072855, "loss": 0.6540067195892334, "mean_token_accuracy": 0.8377440456300974, "num_tokens": 15169526.0, "step": 2840 }, { "entropy": 0.6273791050072759, "epoch": 0.49376834035365075, "grad_norm": 0.2060546875, "learning_rate": 0.00010695325391630308, "loss": 0.6305361747741699, "mean_token_accuracy": 0.8297456104308367, "num_tokens": 15224473.0, "step": 2850 }, { "entropy": 0.59466298725456, "epoch": 0.4955008608461197, "grad_norm": 0.201171875, "learning_rate": 0.00010639330652358058, "loss": 0.5955989360809326, "mean_token_accuracy": 0.837109775096178, "num_tokens": 15281656.0, "step": 2860 }, { "entropy": 0.590182079654187, "epoch": 0.49723338133858863, "grad_norm": 0.2373046875, "learning_rate": 0.00010583315777774696, "loss": 0.6159713745117188, "mean_token_accuracy": 0.8404981274157762, "num_tokens": 15333150.0, "step": 2870 }, { "entropy": 0.57672467129305, "epoch": 0.4989659018310576, "grad_norm": 0.185546875, "learning_rate": 0.00010527282532032969, "loss": 0.5914871215820312, "mean_token_accuracy": 0.8392358284443617, "num_tokens": 15383289.0, "step": 2880 }, { "entropy": 0.5869773568119854, "epoch": 0.5006984223235266, "grad_norm": 0.2158203125, "learning_rate": 0.00010471232679864221, "loss": 0.6114672660827637, "mean_token_accuracy": 0.8400188889354467, "num_tokens": 15438613.0, "step": 2890 }, { "entropy": 0.6136800131760538, "epoch": 0.5024309428159955, "grad_norm": 0.2099609375, "learning_rate": 0.00010415167986522785, "loss": 0.6379248142242432, "mean_token_accuracy": 0.834352083876729, "num_tokens": 15490587.0, "step": 2900 }, { "entropy": 0.6086361592635512, "epoch": 0.5041634633084644, "grad_norm": 0.244140625, "learning_rate": 0.0001035909021773042, "loss": 0.6333293437957763, "mean_token_accuracy": 0.8300730381160975, "num_tokens": 15548870.0, "step": 2910 }, { "entropy": 0.6032880510669202, "epoch": 0.5058959838009334, "grad_norm": 0.1884765625, "learning_rate": 0.00010303001139620689, "loss": 0.6444151878356934, "mean_token_accuracy": 0.8312817770987749, "num_tokens": 15598591.0, "step": 2920 }, { "entropy": 0.5855811305809766, "epoch": 0.5076285042934023, "grad_norm": 0.263671875, "learning_rate": 0.0001024690251868333, "loss": 0.6152175426483154, "mean_token_accuracy": 0.8414902746677398, "num_tokens": 15649064.0, "step": 2930 }, { "entropy": 0.6164896341506392, "epoch": 0.5093610247858713, "grad_norm": 0.1845703125, "learning_rate": 0.00010190796121708628, "loss": 0.6313320159912109, "mean_token_accuracy": 0.8366707745939493, "num_tokens": 15704366.0, "step": 2940 }, { "entropy": 0.5785494175273925, "epoch": 0.5110935452783403, "grad_norm": 0.23046875, "learning_rate": 0.0001013468371573177, "loss": 0.5688902378082276, "mean_token_accuracy": 0.8470625583082437, "num_tokens": 15756519.0, "step": 2950 }, { "entropy": 0.5922784093767405, "epoch": 0.5128260657708092, "grad_norm": 0.1708984375, "learning_rate": 0.00010078567067977191, "loss": 0.6074170589447021, "mean_token_accuracy": 0.838723149895668, "num_tokens": 15811567.0, "step": 2960 }, { "entropy": 0.5760424341075122, "epoch": 0.5145585862632781, "grad_norm": 0.1982421875, "learning_rate": 0.00010022447945802917, "loss": 0.5844903945922851, "mean_token_accuracy": 0.8425237882882357, "num_tokens": 15864474.0, "step": 2970 }, { "entropy": 0.6029307945631445, "epoch": 0.5162911067557471, "grad_norm": 0.2109375, "learning_rate": 9.96632811664491e-05, "loss": 0.6089130401611328, "mean_token_accuracy": 0.8375063575804234, "num_tokens": 15915223.0, "step": 2980 }, { "entropy": 0.5315724958200008, "epoch": 0.518023627248216, "grad_norm": 0.2109375, "learning_rate": 9.910209347961389e-05, "loss": 0.5239943027496338, "mean_token_accuracy": 0.8512597348541021, "num_tokens": 15973757.0, "step": 2990 }, { "entropy": 0.574950763490051, "epoch": 0.519756147740685, "grad_norm": 0.2060546875, "learning_rate": 9.854093407177184e-05, "loss": 0.5746850490570068, "mean_token_accuracy": 0.8381776563823223, "num_tokens": 16025972.0, "step": 3000 }, { "entropy": 0.5852484166156501, "epoch": 0.521488668233154, "grad_norm": 0.16796875, "learning_rate": 9.797982061628055e-05, "loss": 0.5965889453887939, "mean_token_accuracy": 0.8383524172008038, "num_tokens": 16076695.0, "step": 3010 }, { "entropy": 0.5634748952230438, "epoch": 0.5232211887256228, "grad_norm": 0.2265625, "learning_rate": 9.741877078505045e-05, "loss": 0.5513391494750977, "mean_token_accuracy": 0.8460137024521828, "num_tokens": 16135215.0, "step": 3020 }, { "entropy": 0.5869616455864162, "epoch": 0.5249537092180918, "grad_norm": 0.2138671875, "learning_rate": 9.685780224798805e-05, "loss": 0.5826962471008301, "mean_token_accuracy": 0.8386240437626838, "num_tokens": 16188506.0, "step": 3030 }, { "entropy": 0.5738142973743379, "epoch": 0.5266862297105608, "grad_norm": 0.2197265625, "learning_rate": 9.629693267243962e-05, "loss": 0.5730494499206543, "mean_token_accuracy": 0.840570829808712, "num_tokens": 16243964.0, "step": 3040 }, { "entropy": 0.5921493870206177, "epoch": 0.5284187502030298, "grad_norm": 0.23828125, "learning_rate": 9.573617972263478e-05, "loss": 0.6039523124694824, "mean_token_accuracy": 0.8394287832081317, "num_tokens": 16299274.0, "step": 3050 }, { "entropy": 0.6072209506295622, "epoch": 0.5301512706954987, "grad_norm": 0.185546875, "learning_rate": 9.517556105912995e-05, "loss": 0.6261641979217529, "mean_token_accuracy": 0.8376805637031793, "num_tokens": 16355409.0, "step": 3060 }, { "entropy": 0.6185756172519177, "epoch": 0.5318837911879677, "grad_norm": 0.255859375, "learning_rate": 9.461509433825238e-05, "loss": 0.6353075504302979, "mean_token_accuracy": 0.8332322388887405, "num_tokens": 16410386.0, "step": 3070 }, { "entropy": 0.6121521357446909, "epoch": 0.5336163116804366, "grad_norm": 0.26171875, "learning_rate": 9.405479721154391e-05, "loss": 0.6405570983886719, "mean_token_accuracy": 0.8331318866461516, "num_tokens": 16464158.0, "step": 3080 }, { "entropy": 0.6069775213487446, "epoch": 0.5353488321729055, "grad_norm": 0.19140625, "learning_rate": 9.349468732520529e-05, "loss": 0.5938554763793945, "mean_token_accuracy": 0.8324613347649574, "num_tokens": 16521666.0, "step": 3090 }, { "entropy": 0.5699784771772102, "epoch": 0.5370813526653745, "grad_norm": 0.228515625, "learning_rate": 9.293478231953997e-05, "loss": 0.5687154293060303, "mean_token_accuracy": 0.8443257499486208, "num_tokens": 16576188.0, "step": 3100 }, { "entropy": 0.5675219805445522, "epoch": 0.5388138731578435, "grad_norm": 0.22265625, "learning_rate": 9.23750998283991e-05, "loss": 0.5806581020355225, "mean_token_accuracy": 0.843117181584239, "num_tokens": 16626551.0, "step": 3110 }, { "entropy": 0.5873679893091321, "epoch": 0.5405463936503124, "grad_norm": 0.18359375, "learning_rate": 9.181565747862574e-05, "loss": 0.6099284172058106, "mean_token_accuracy": 0.8380186520516872, "num_tokens": 16679481.0, "step": 3120 }, { "entropy": 0.5710663202451542, "epoch": 0.5422789141427814, "grad_norm": 0.15625, "learning_rate": 9.125647288949981e-05, "loss": 0.5839220523834229, "mean_token_accuracy": 0.8431031309068203, "num_tokens": 16732976.0, "step": 3130 }, { "entropy": 0.596511066146195, "epoch": 0.5440114346352503, "grad_norm": 0.197265625, "learning_rate": 9.069756367218331e-05, "loss": 0.6071121692657471, "mean_token_accuracy": 0.8361073154956102, "num_tokens": 16789389.0, "step": 3140 }, { "entropy": 0.6210895074298606, "epoch": 0.5457439551277192, "grad_norm": 0.2021484375, "learning_rate": 9.013894742916553e-05, "loss": 0.6283562660217286, "mean_token_accuracy": 0.8354116972535849, "num_tokens": 16846677.0, "step": 3150 }, { "entropy": 0.596269681211561, "epoch": 0.5474764756201882, "grad_norm": 0.2451171875, "learning_rate": 8.958064175370883e-05, "loss": 0.5808255195617675, "mean_token_accuracy": 0.838775647431612, "num_tokens": 16896654.0, "step": 3160 }, { "entropy": 0.5483348882757128, "epoch": 0.5492089961126572, "grad_norm": 0.1787109375, "learning_rate": 8.90226642292942e-05, "loss": 0.5343601703643799, "mean_token_accuracy": 0.8485178887844086, "num_tokens": 16944739.0, "step": 3170 }, { "entropy": 0.5849819808034227, "epoch": 0.5509415166051261, "grad_norm": 0.2451171875, "learning_rate": 8.846503242906798e-05, "loss": 0.624034833908081, "mean_token_accuracy": 0.8375435929745436, "num_tokens": 17001792.0, "step": 3180 }, { "entropy": 0.5735263123176992, "epoch": 0.552674037097595, "grad_norm": 0.240234375, "learning_rate": 8.790776391528803e-05, "loss": 0.5884189128875732, "mean_token_accuracy": 0.8433846581727267, "num_tokens": 17057122.0, "step": 3190 }, { "entropy": 0.5874220591969788, "epoch": 0.554406557590064, "grad_norm": 0.189453125, "learning_rate": 8.73508762387707e-05, "loss": 0.5811627864837646, "mean_token_accuracy": 0.840981874614954, "num_tokens": 17109057.0, "step": 3200 }, { "entropy": 0.5672381565906107, "epoch": 0.5561390780825329, "grad_norm": 0.26953125, "learning_rate": 8.679438693833822e-05, "loss": 0.5794447898864746, "mean_token_accuracy": 0.8454991206526756, "num_tokens": 17164048.0, "step": 3210 }, { "entropy": 0.571211804356426, "epoch": 0.5578715985750019, "grad_norm": 0.28125, "learning_rate": 8.623831354026608e-05, "loss": 0.5618424892425538, "mean_token_accuracy": 0.8462431959807872, "num_tokens": 17221820.0, "step": 3220 }, { "entropy": 0.60764075294137, "epoch": 0.5596041190674709, "grad_norm": 0.19921875, "learning_rate": 8.568267355773137e-05, "loss": 0.6284051895141601, "mean_token_accuracy": 0.8340359356254339, "num_tokens": 17274399.0, "step": 3230 }, { "entropy": 0.5799334913026541, "epoch": 0.5613366395599398, "grad_norm": 0.2431640625, "learning_rate": 8.512748449026087e-05, "loss": 0.5892360210418701, "mean_token_accuracy": 0.842689898610115, "num_tokens": 17327372.0, "step": 3240 }, { "entropy": 0.5794768249150366, "epoch": 0.5630691600524087, "grad_norm": 0.189453125, "learning_rate": 8.457276382318015e-05, "loss": 0.5738996505737305, "mean_token_accuracy": 0.8423306241631507, "num_tokens": 17383576.0, "step": 3250 }, { "entropy": 0.6024962943978608, "epoch": 0.5648016805448777, "grad_norm": 0.25, "learning_rate": 8.401852902706285e-05, "loss": 0.5932654857635498, "mean_token_accuracy": 0.836880574375391, "num_tokens": 17436218.0, "step": 3260 }, { "entropy": 0.5578272269805893, "epoch": 0.5665342010373466, "grad_norm": 0.177734375, "learning_rate": 8.346479755718028e-05, "loss": 0.5810702323913575, "mean_token_accuracy": 0.8456843707710504, "num_tokens": 17493828.0, "step": 3270 }, { "entropy": 0.5836522807134316, "epoch": 0.5682667215298156, "grad_norm": 0.2041015625, "learning_rate": 8.29115868529519e-05, "loss": 0.5958133220672608, "mean_token_accuracy": 0.8417525358498097, "num_tokens": 17546507.0, "step": 3280 }, { "entropy": 0.582007565535605, "epoch": 0.5699992420222846, "grad_norm": 0.19921875, "learning_rate": 8.235891433739607e-05, "loss": 0.5615264892578125, "mean_token_accuracy": 0.8410556487739086, "num_tokens": 17599245.0, "step": 3290 }, { "entropy": 0.5506704148836434, "epoch": 0.5717317625147535, "grad_norm": 0.22265625, "learning_rate": 8.18067974165811e-05, "loss": 0.5327036380767822, "mean_token_accuracy": 0.8516118418425321, "num_tokens": 17644967.0, "step": 3300 }, { "entropy": 0.5811622153501957, "epoch": 0.5734642830072224, "grad_norm": 0.29296875, "learning_rate": 8.125525347907725e-05, "loss": 0.6177726268768311, "mean_token_accuracy": 0.8396083325147629, "num_tokens": 17700648.0, "step": 3310 }, { "entropy": 0.5715690411627292, "epoch": 0.5751968034996914, "grad_norm": 0.2080078125, "learning_rate": 8.070429989540903e-05, "loss": 0.6089767456054688, "mean_token_accuracy": 0.8419048462063075, "num_tokens": 17759453.0, "step": 3320 }, { "entropy": 0.6150133638642729, "epoch": 0.5769293239921603, "grad_norm": 0.2392578125, "learning_rate": 8.015395401750816e-05, "loss": 0.6307916641235352, "mean_token_accuracy": 0.8332836613059044, "num_tokens": 17815319.0, "step": 3330 }, { "entropy": 0.6224826156627387, "epoch": 0.5786618444846293, "grad_norm": 0.24609375, "learning_rate": 7.960423317816707e-05, "loss": 0.6409733772277832, "mean_token_accuracy": 0.8375802997499704, "num_tokens": 17864939.0, "step": 3340 }, { "entropy": 0.588920985115692, "epoch": 0.5803943649770983, "grad_norm": 0.2265625, "learning_rate": 7.905515469049287e-05, "loss": 0.5952839374542236, "mean_token_accuracy": 0.8417891424149275, "num_tokens": 17918216.0, "step": 3350 }, { "entropy": 0.5630837785080075, "epoch": 0.5821268854695671, "grad_norm": 0.185546875, "learning_rate": 7.850673584736238e-05, "loss": 0.5541327953338623, "mean_token_accuracy": 0.8466249253600836, "num_tokens": 17975742.0, "step": 3360 }, { "entropy": 0.575827946467325, "epoch": 0.5838594059620361, "grad_norm": 0.2041015625, "learning_rate": 7.795899392087727e-05, "loss": 0.6097724914550782, "mean_token_accuracy": 0.8444040916860104, "num_tokens": 18029585.0, "step": 3370 }, { "entropy": 0.5849282233975828, "epoch": 0.5855919264545051, "grad_norm": 0.1884765625, "learning_rate": 7.74119461618201e-05, "loss": 0.5895652294158935, "mean_token_accuracy": 0.8412786796689034, "num_tokens": 18077047.0, "step": 3380 }, { "entropy": 0.589809303288348, "epoch": 0.587324446946974, "grad_norm": 0.2109375, "learning_rate": 7.686560979911115e-05, "loss": 0.6017866134643555, "mean_token_accuracy": 0.841454528272152, "num_tokens": 18131882.0, "step": 3390 }, { "entropy": 0.5898898280225694, "epoch": 0.589056967439443, "grad_norm": 0.22265625, "learning_rate": 7.632000203926565e-05, "loss": 0.5839109420776367, "mean_token_accuracy": 0.8408774256706237, "num_tokens": 18187052.0, "step": 3400 }, { "entropy": 0.59212601990439, "epoch": 0.590789487931912, "grad_norm": 0.1611328125, "learning_rate": 7.577514006585209e-05, "loss": 0.6250973224639893, "mean_token_accuracy": 0.8377660803496838, "num_tokens": 18239107.0, "step": 3410 }, { "entropy": 0.5656685329508037, "epoch": 0.5925220084243809, "grad_norm": 0.2001953125, "learning_rate": 7.523104103895065e-05, "loss": 0.5862621307373047, "mean_token_accuracy": 0.8441399410367012, "num_tokens": 18290779.0, "step": 3420 }, { "entropy": 0.5759195055346936, "epoch": 0.5942545289168498, "grad_norm": 0.251953125, "learning_rate": 7.468772209461323e-05, "loss": 0.5872469425201416, "mean_token_accuracy": 0.8414444755762815, "num_tokens": 18341930.0, "step": 3430 }, { "entropy": 0.5839247035328299, "epoch": 0.5959870494093188, "grad_norm": 0.283203125, "learning_rate": 7.414520034432344e-05, "loss": 0.5958654880523682, "mean_token_accuracy": 0.8407564666122198, "num_tokens": 18394611.0, "step": 3440 }, { "entropy": 0.5786849300027825, "epoch": 0.5977195699017878, "grad_norm": 0.255859375, "learning_rate": 7.360349287445774e-05, "loss": 0.5799434661865235, "mean_token_accuracy": 0.8445678118616342, "num_tokens": 18450041.0, "step": 3450 }, { "entropy": 0.5935896479059011, "epoch": 0.5994520903942567, "grad_norm": 0.21484375, "learning_rate": 7.306261674574733e-05, "loss": 0.5947081565856933, "mean_token_accuracy": 0.8432171389460563, "num_tokens": 18507564.0, "step": 3460 }, { "entropy": 0.5749802350997925, "epoch": 0.6011846108867256, "grad_norm": 0.26171875, "learning_rate": 7.252258899274095e-05, "loss": 0.5716835498809815, "mean_token_accuracy": 0.8433140508830548, "num_tokens": 18559199.0, "step": 3470 }, { "entropy": 0.54188243271783, "epoch": 0.6029171313791946, "grad_norm": 0.150390625, "learning_rate": 7.198342662326827e-05, "loss": 0.5425021171569824, "mean_token_accuracy": 0.8488159842789174, "num_tokens": 18609440.0, "step": 3480 }, { "entropy": 0.5910465456545353, "epoch": 0.6046496518716635, "grad_norm": 0.1845703125, "learning_rate": 7.144514661790413e-05, "loss": 0.6077436447143555, "mean_token_accuracy": 0.8387968797236681, "num_tokens": 18668681.0, "step": 3490 }, { "entropy": 0.601060884213075, "epoch": 0.6063821723641325, "grad_norm": 0.1904296875, "learning_rate": 7.090776592943402e-05, "loss": 0.604709243774414, "mean_token_accuracy": 0.8362816657871008, "num_tokens": 18723477.0, "step": 3500 }, { "entropy": 0.5889260085299611, "epoch": 0.6081146928566015, "grad_norm": 0.248046875, "learning_rate": 7.037130148231998e-05, "loss": 0.6148191452026367, "mean_token_accuracy": 0.8380883693695068, "num_tokens": 18781011.0, "step": 3510 }, { "entropy": 0.5905653207097202, "epoch": 0.6098472133490704, "grad_norm": 0.1884765625, "learning_rate": 6.983577017216754e-05, "loss": 0.5685397624969483, "mean_token_accuracy": 0.8412429638206959, "num_tokens": 18836362.0, "step": 3520 }, { "entropy": 0.561858502868563, "epoch": 0.6115797338415393, "grad_norm": 0.197265625, "learning_rate": 6.930118886519374e-05, "loss": 0.5529529094696045, "mean_token_accuracy": 0.8480452511459589, "num_tokens": 18889944.0, "step": 3530 }, { "entropy": 0.5512642343412153, "epoch": 0.6133122543340083, "grad_norm": 0.212890625, "learning_rate": 6.876757439769593e-05, "loss": 0.5571891784667968, "mean_token_accuracy": 0.850096445158124, "num_tokens": 18944063.0, "step": 3540 }, { "entropy": 0.5728070291690528, "epoch": 0.6150447748264772, "grad_norm": 0.208984375, "learning_rate": 6.823494357552136e-05, "loss": 0.5640948295593262, "mean_token_accuracy": 0.8431723900139332, "num_tokens": 18991394.0, "step": 3550 }, { "entropy": 0.5761209703050554, "epoch": 0.6167772953189462, "grad_norm": 0.17578125, "learning_rate": 6.770331317353805e-05, "loss": 0.5933984279632568, "mean_token_accuracy": 0.8404323156923056, "num_tokens": 19051491.0, "step": 3560 }, { "entropy": 0.5795182818546891, "epoch": 0.6185098158114152, "grad_norm": 0.1884765625, "learning_rate": 6.717269993510642e-05, "loss": 0.5945269107818604, "mean_token_accuracy": 0.8381262317299842, "num_tokens": 19103454.0, "step": 3570 }, { "entropy": 0.586546707386151, "epoch": 0.6202423363038841, "grad_norm": 0.1865234375, "learning_rate": 6.664312057155199e-05, "loss": 0.6067633628845215, "mean_token_accuracy": 0.8356157563626766, "num_tokens": 19155618.0, "step": 3580 }, { "entropy": 0.5642004692927003, "epoch": 0.621974856796353, "grad_norm": 0.20703125, "learning_rate": 6.611459176163898e-05, "loss": 0.570903205871582, "mean_token_accuracy": 0.8450221214443445, "num_tokens": 19207279.0, "step": 3590 }, { "entropy": 0.5884431241080165, "epoch": 0.623707377288822, "grad_norm": 0.185546875, "learning_rate": 6.558713015104518e-05, "loss": 0.5947638988494873, "mean_token_accuracy": 0.839688852056861, "num_tokens": 19260880.0, "step": 3600 }, { "entropy": 0.5753527913009748, "epoch": 0.6254398977812909, "grad_norm": 0.208984375, "learning_rate": 6.50607523518376e-05, "loss": 0.5739696979522705, "mean_token_accuracy": 0.843867740407586, "num_tokens": 19314460.0, "step": 3610 }, { "entropy": 0.6017448433674872, "epoch": 0.6271724182737599, "grad_norm": 0.21484375, "learning_rate": 6.453547494194929e-05, "loss": 0.6191208839416504, "mean_token_accuracy": 0.8382684826850891, "num_tokens": 19368549.0, "step": 3620 }, { "entropy": 0.5728473928757012, "epoch": 0.6289049387662289, "grad_norm": 0.212890625, "learning_rate": 6.401131446465718e-05, "loss": 0.5917435646057129, "mean_token_accuracy": 0.8433002319186926, "num_tokens": 19424310.0, "step": 3630 }, { "entropy": 0.6017072153743357, "epoch": 0.6306374592586977, "grad_norm": 0.1923828125, "learning_rate": 6.348828742806121e-05, "loss": 0.6305885791778565, "mean_token_accuracy": 0.8348235942423343, "num_tokens": 19475276.0, "step": 3640 }, { "entropy": 0.5752246322226711, "epoch": 0.6323699797511667, "grad_norm": 0.25390625, "learning_rate": 6.296641030456431e-05, "loss": 0.5686737060546875, "mean_token_accuracy": 0.8426034320145845, "num_tokens": 19527832.0, "step": 3650 }, { "entropy": 0.5501401219982653, "epoch": 0.6341025002436357, "grad_norm": 0.244140625, "learning_rate": 6.244569953035355e-05, "loss": 0.5381704807281494, "mean_token_accuracy": 0.8496629562228918, "num_tokens": 19578680.0, "step": 3660 }, { "entropy": 0.5852787056937814, "epoch": 0.6358350207361047, "grad_norm": 0.2265625, "learning_rate": 6.19261715048827e-05, "loss": 0.5736754417419434, "mean_token_accuracy": 0.8424856297671794, "num_tokens": 19631489.0, "step": 3670 }, { "entropy": 0.5958160690963268, "epoch": 0.6375675412285736, "grad_norm": 0.255859375, "learning_rate": 6.140784259035552e-05, "loss": 0.6208570957183838, "mean_token_accuracy": 0.8383866585791111, "num_tokens": 19684521.0, "step": 3680 }, { "entropy": 0.5951701735146344, "epoch": 0.6393000617210426, "grad_norm": 0.203125, "learning_rate": 6.089072911121061e-05, "loss": 0.6026985168457031, "mean_token_accuracy": 0.8411695055663586, "num_tokens": 19740764.0, "step": 3690 }, { "entropy": 0.575906784972176, "epoch": 0.6410325822135114, "grad_norm": 0.3125, "learning_rate": 6.037484735360711e-05, "loss": 0.5890356063842773, "mean_token_accuracy": 0.842427759245038, "num_tokens": 19793481.0, "step": 3700 }, { "entropy": 0.5695828476920723, "epoch": 0.6427651027059804, "grad_norm": 0.1943359375, "learning_rate": 5.9860213564911916e-05, "loss": 0.5620457649230957, "mean_token_accuracy": 0.8452866446226835, "num_tokens": 19844497.0, "step": 3710 }, { "entropy": 0.5581729131285101, "epoch": 0.6444976231984494, "grad_norm": 0.19140625, "learning_rate": 5.934684395318806e-05, "loss": 0.5511328697204589, "mean_token_accuracy": 0.8449296887964011, "num_tokens": 19894794.0, "step": 3720 }, { "entropy": 0.5855876510962844, "epoch": 0.6462301436909184, "grad_norm": 0.2041015625, "learning_rate": 5.8834754686683866e-05, "loss": 0.5966204166412353, "mean_token_accuracy": 0.8407878663390875, "num_tokens": 19947818.0, "step": 3730 }, { "entropy": 0.5957442070823162, "epoch": 0.6479626641833873, "grad_norm": 0.1826171875, "learning_rate": 5.832396189332423e-05, "loss": 0.60280442237854, "mean_token_accuracy": 0.8375787112861872, "num_tokens": 20003002.0, "step": 3740 }, { "entropy": 0.6144319356419146, "epoch": 0.6496951846758563, "grad_norm": 0.326171875, "learning_rate": 5.7814481660202424e-05, "loss": 0.611343240737915, "mean_token_accuracy": 0.8361466400325298, "num_tokens": 20053817.0, "step": 3750 }, { "entropy": 0.5885245742741972, "epoch": 0.6514277051683252, "grad_norm": 0.30859375, "learning_rate": 5.7306330033073376e-05, "loss": 0.5991326808929444, "mean_token_accuracy": 0.8377312365919352, "num_tokens": 20106764.0, "step": 3760 }, { "entropy": 0.5618473440874368, "epoch": 0.6531602256607941, "grad_norm": 0.255859375, "learning_rate": 5.679952301584844e-05, "loss": 0.5703360080718994, "mean_token_accuracy": 0.8465285055339337, "num_tokens": 20159017.0, "step": 3770 }, { "entropy": 0.6042450641281902, "epoch": 0.6548927461532631, "grad_norm": 0.205078125, "learning_rate": 5.629407657009143e-05, "loss": 0.5915566444396972, "mean_token_accuracy": 0.8349285993725062, "num_tokens": 20215650.0, "step": 3780 }, { "entropy": 0.571340271178633, "epoch": 0.6566252666457321, "grad_norm": 0.1689453125, "learning_rate": 5.579000661451573e-05, "loss": 0.5710691928863525, "mean_token_accuracy": 0.8451083436608314, "num_tokens": 20276446.0, "step": 3790 }, { "entropy": 0.5754610357806087, "epoch": 0.658357787138201, "grad_norm": 0.201171875, "learning_rate": 5.528732902448305e-05, "loss": 0.5327680110931396, "mean_token_accuracy": 0.844481249153614, "num_tokens": 20328728.0, "step": 3800 }, { "entropy": 0.6063968134578317, "epoch": 0.6600903076306699, "grad_norm": 0.1748046875, "learning_rate": 5.478605963150347e-05, "loss": 0.6289023876190185, "mean_token_accuracy": 0.8358895625919104, "num_tokens": 20382682.0, "step": 3810 }, { "entropy": 0.5941935436567292, "epoch": 0.6618228281231389, "grad_norm": 0.1611328125, "learning_rate": 5.4286214222736875e-05, "loss": 0.5898853778839112, "mean_token_accuracy": 0.8419016167521477, "num_tokens": 20435410.0, "step": 3820 }, { "entropy": 0.579904412291944, "epoch": 0.6635553486156078, "grad_norm": 0.1787109375, "learning_rate": 5.3787808540495534e-05, "loss": 0.5740793704986572, "mean_token_accuracy": 0.8450499411672354, "num_tokens": 20488002.0, "step": 3830 }, { "entropy": 0.5939912447705865, "epoch": 0.6652878691080768, "grad_norm": 0.1923828125, "learning_rate": 5.329085828174847e-05, "loss": 0.5808038234710693, "mean_token_accuracy": 0.8370831325650215, "num_tokens": 20537293.0, "step": 3840 }, { "entropy": 0.5658927114214748, "epoch": 0.6670203896005458, "grad_norm": 0.251953125, "learning_rate": 5.27953790976272e-05, "loss": 0.5806662559509277, "mean_token_accuracy": 0.8480444595217704, "num_tokens": 20592677.0, "step": 3850 }, { "entropy": 0.5773649536306038, "epoch": 0.6687529100930147, "grad_norm": 0.1845703125, "learning_rate": 5.230138659293253e-05, "loss": 0.618853759765625, "mean_token_accuracy": 0.8424112224951387, "num_tokens": 20645296.0, "step": 3860 }, { "entropy": 0.5486746313516051, "epoch": 0.6704854305854836, "grad_norm": 0.1708984375, "learning_rate": 5.180889632564331e-05, "loss": 0.5274429321289062, "mean_token_accuracy": 0.8531730443239212, "num_tokens": 20696642.0, "step": 3870 }, { "entropy": 0.572584178717807, "epoch": 0.6722179510779526, "grad_norm": 0.208984375, "learning_rate": 5.131792380642639e-05, "loss": 0.5815223693847656, "mean_token_accuracy": 0.8469138272106648, "num_tokens": 20748366.0, "step": 3880 }, { "entropy": 0.5805146366590634, "epoch": 0.6739504715704215, "grad_norm": 0.2001953125, "learning_rate": 5.082848449814815e-05, "loss": 0.6078445434570312, "mean_token_accuracy": 0.8376872267574071, "num_tokens": 20799591.0, "step": 3890 }, { "entropy": 0.5745012188563123, "epoch": 0.6756829920628905, "grad_norm": 0.2265625, "learning_rate": 5.0340593815387394e-05, "loss": 0.578024435043335, "mean_token_accuracy": 0.8426983803510666, "num_tokens": 20854587.0, "step": 3900 }, { "entropy": 0.5941596085438505, "epoch": 0.6774155125553595, "grad_norm": 0.2060546875, "learning_rate": 4.985426712394994e-05, "loss": 0.6132090568542481, "mean_token_accuracy": 0.8365705825388432, "num_tokens": 20905558.0, "step": 3910 }, { "entropy": 0.558493199152872, "epoch": 0.6791480330478284, "grad_norm": 0.2177734375, "learning_rate": 4.9369519740384805e-05, "loss": 0.5631945610046387, "mean_token_accuracy": 0.8453404325991869, "num_tokens": 20961477.0, "step": 3920 }, { "entropy": 0.6204601846635341, "epoch": 0.6808805535402973, "grad_norm": 0.2255859375, "learning_rate": 4.8886366931501614e-05, "loss": 0.6358794689178466, "mean_token_accuracy": 0.8305168882012367, "num_tokens": 21009478.0, "step": 3930 }, { "entropy": 0.5932569999014958, "epoch": 0.6826130740327663, "grad_norm": 0.314453125, "learning_rate": 4.840482391388987e-05, "loss": 0.5845652103424073, "mean_token_accuracy": 0.8384004920721054, "num_tokens": 21062772.0, "step": 3940 }, { "entropy": 0.5521581314504147, "epoch": 0.6843455945252352, "grad_norm": 0.21875, "learning_rate": 4.792490585343983e-05, "loss": 0.5398716926574707, "mean_token_accuracy": 0.8492032889276743, "num_tokens": 21114869.0, "step": 3950 }, { "entropy": 0.583714248938486, "epoch": 0.6860781150177042, "grad_norm": 0.1728515625, "learning_rate": 4.744662786486471e-05, "loss": 0.5952413558959961, "mean_token_accuracy": 0.8407733146101236, "num_tokens": 21172791.0, "step": 3960 }, { "entropy": 0.5898357476107776, "epoch": 0.6878106355101732, "grad_norm": 0.1923828125, "learning_rate": 4.697000501122467e-05, "loss": 0.5954113006591797, "mean_token_accuracy": 0.8401012167334556, "num_tokens": 21228419.0, "step": 3970 }, { "entropy": 0.548321096599102, "epoch": 0.689543156002642, "grad_norm": 0.193359375, "learning_rate": 4.649505230345244e-05, "loss": 0.5236709117889404, "mean_token_accuracy": 0.8472159929573536, "num_tokens": 21281778.0, "step": 3980 }, { "entropy": 0.5716894276440143, "epoch": 0.691275676495111, "grad_norm": 0.2119140625, "learning_rate": 4.602178469988064e-05, "loss": 0.570991039276123, "mean_token_accuracy": 0.8435146156698465, "num_tokens": 21335385.0, "step": 3990 }, { "entropy": 0.5994025730295107, "epoch": 0.69300819698758, "grad_norm": 0.1884765625, "learning_rate": 4.5550217105770674e-05, "loss": 0.5998933792114258, "mean_token_accuracy": 0.8382619321346283, "num_tokens": 21393082.0, "step": 4000 }, { "entropy": 0.5763973373454064, "epoch": 0.694740717480049, "grad_norm": 0.2060546875, "learning_rate": 4.5080364372842976e-05, "loss": 0.5872276306152344, "mean_token_accuracy": 0.8479617930948734, "num_tokens": 21445710.0, "step": 4010 }, { "entropy": 0.6155249847099185, "epoch": 0.6964732379725179, "grad_norm": 0.19921875, "learning_rate": 4.4612241298809756e-05, "loss": 0.63254714012146, "mean_token_accuracy": 0.8309660295024515, "num_tokens": 21499068.0, "step": 4020 }, { "entropy": 0.5553503627888858, "epoch": 0.6982057584649869, "grad_norm": 0.251953125, "learning_rate": 4.4145862626908684e-05, "loss": 0.5443556308746338, "mean_token_accuracy": 0.8461846563965082, "num_tokens": 21549682.0, "step": 4030 }, { "entropy": 0.53650197731331, "epoch": 0.6999382789574558, "grad_norm": 0.2109375, "learning_rate": 4.3681243045438515e-05, "loss": 0.5042569160461425, "mean_token_accuracy": 0.8553239502012729, "num_tokens": 21602773.0, "step": 4040 }, { "entropy": 0.5737016116734595, "epoch": 0.7016707994499247, "grad_norm": 0.1943359375, "learning_rate": 4.32183971872966e-05, "loss": 0.5885915279388427, "mean_token_accuracy": 0.8434899553656579, "num_tokens": 21652306.0, "step": 4050 }, { "entropy": 0.5552554502850399, "epoch": 0.7034033199423937, "grad_norm": 0.2412109375, "learning_rate": 4.2757339629518035e-05, "loss": 0.5580289840698243, "mean_token_accuracy": 0.8487752258777619, "num_tokens": 21703372.0, "step": 4060 }, { "entropy": 0.5768985984381289, "epoch": 0.7051358404348627, "grad_norm": 0.251953125, "learning_rate": 4.229808489281657e-05, "loss": 0.6017580032348633, "mean_token_accuracy": 0.8439400654286147, "num_tokens": 21755926.0, "step": 4070 }, { "entropy": 0.6120095189660788, "epoch": 0.7068683609273316, "grad_norm": 0.2216796875, "learning_rate": 4.184064744112718e-05, "loss": 0.6320703506469727, "mean_token_accuracy": 0.8355493500828743, "num_tokens": 21812681.0, "step": 4080 }, { "entropy": 0.5636088127736002, "epoch": 0.7086008814198006, "grad_norm": 0.2119140625, "learning_rate": 4.1385041681150594e-05, "loss": 0.5749011993408203, "mean_token_accuracy": 0.8419094953685999, "num_tokens": 21867716.0, "step": 4090 }, { "entropy": 0.5694676558021456, "epoch": 0.7103334019122695, "grad_norm": 0.2275390625, "learning_rate": 4.09312819618997e-05, "loss": 0.5456663608551026, "mean_token_accuracy": 0.8421003673225641, "num_tokens": 21918203.0, "step": 4100 }, { "entropy": 0.5702879796735942, "epoch": 0.7120659224047384, "grad_norm": 0.251953125, "learning_rate": 4.047938257424739e-05, "loss": 0.5769749641418457, "mean_token_accuracy": 0.840731156617403, "num_tokens": 21969601.0, "step": 4110 }, { "entropy": 0.5680196524597705, "epoch": 0.7137984428972074, "grad_norm": 0.22265625, "learning_rate": 4.00293577504766e-05, "loss": 0.5617639064788819, "mean_token_accuracy": 0.8453905589878559, "num_tokens": 22023823.0, "step": 4120 }, { "entropy": 0.5798379408195615, "epoch": 0.7155309633896764, "grad_norm": 0.2119140625, "learning_rate": 3.9581221663832166e-05, "loss": 0.6011070728302002, "mean_token_accuracy": 0.8384223252534866, "num_tokens": 22076897.0, "step": 4130 }, { "entropy": 0.5674789244541898, "epoch": 0.7172634838821453, "grad_norm": 0.244140625, "learning_rate": 3.913498842807433e-05, "loss": 0.5677319049835206, "mean_token_accuracy": 0.8429323259741068, "num_tokens": 22132468.0, "step": 4140 }, { "entropy": 0.5730633283033967, "epoch": 0.7189960043746142, "grad_norm": 0.1953125, "learning_rate": 3.8690672097034186e-05, "loss": 0.59276442527771, "mean_token_accuracy": 0.8416654709726572, "num_tokens": 22186702.0, "step": 4150 }, { "entropy": 0.6094420235138387, "epoch": 0.7207285248670832, "grad_norm": 0.251953125, "learning_rate": 3.824828666417114e-05, "loss": 0.6083714008331299, "mean_token_accuracy": 0.8370202928781509, "num_tokens": 22239147.0, "step": 4160 }, { "entropy": 0.5858336496166885, "epoch": 0.7224610453595521, "grad_norm": 0.267578125, "learning_rate": 3.780784606213229e-05, "loss": 0.6024020671844482, "mean_token_accuracy": 0.8398869067430497, "num_tokens": 22291494.0, "step": 4170 }, { "entropy": 0.5746008921880275, "epoch": 0.7241935658520211, "grad_norm": 0.193359375, "learning_rate": 3.7369364162313525e-05, "loss": 0.5637946605682373, "mean_token_accuracy": 0.8452662628144025, "num_tokens": 22347209.0, "step": 4180 }, { "entropy": 0.5705623811576516, "epoch": 0.7259260863444901, "grad_norm": 0.240234375, "learning_rate": 3.693285477442245e-05, "loss": 0.558026123046875, "mean_token_accuracy": 0.8441093850880861, "num_tokens": 22402861.0, "step": 4190 }, { "entropy": 0.6150487074628472, "epoch": 0.727658606836959, "grad_norm": 0.2412109375, "learning_rate": 3.6498331646043915e-05, "loss": 0.6077510833740234, "mean_token_accuracy": 0.8339765869081021, "num_tokens": 22459561.0, "step": 4200 }, { "entropy": 0.5854987013153732, "epoch": 0.7293911273294279, "grad_norm": 0.154296875, "learning_rate": 3.606580846220671e-05, "loss": 0.5959908485412597, "mean_token_accuracy": 0.8377656571567058, "num_tokens": 22513317.0, "step": 4210 }, { "entropy": 0.5632983278017492, "epoch": 0.7311236478218969, "grad_norm": 0.33984375, "learning_rate": 3.563529884495259e-05, "loss": 0.5580694675445557, "mean_token_accuracy": 0.8474770098924637, "num_tokens": 22567784.0, "step": 4220 }, { "entropy": 0.5178743036929518, "epoch": 0.7328561683143658, "grad_norm": 0.1845703125, "learning_rate": 3.5206816352907347e-05, "loss": 0.5083220958709717, "mean_token_accuracy": 0.8617038175463676, "num_tokens": 22620493.0, "step": 4230 }, { "entropy": 0.5757345825433731, "epoch": 0.7345886888068348, "grad_norm": 0.2138671875, "learning_rate": 3.478037448085377e-05, "loss": 0.5746479034423828, "mean_token_accuracy": 0.8421594180166722, "num_tokens": 22667711.0, "step": 4240 }, { "entropy": 0.5781311514321714, "epoch": 0.7363212092993038, "grad_norm": 0.169921875, "learning_rate": 3.435598665930672e-05, "loss": 0.5761359214782715, "mean_token_accuracy": 0.8447645794600248, "num_tokens": 22715914.0, "step": 4250 }, { "entropy": 0.555015804246068, "epoch": 0.7380537297917726, "grad_norm": 0.220703125, "learning_rate": 3.393366625408979e-05, "loss": 0.5434780597686768, "mean_token_accuracy": 0.8475862570106983, "num_tokens": 22772021.0, "step": 4260 }, { "entropy": 0.5712562045897357, "epoch": 0.7397862502842416, "grad_norm": 0.177734375, "learning_rate": 3.351342656591485e-05, "loss": 0.5471843719482422, "mean_token_accuracy": 0.8448881905525922, "num_tokens": 22828411.0, "step": 4270 }, { "entropy": 0.5824979926692322, "epoch": 0.7415187707767106, "grad_norm": 0.22265625, "learning_rate": 3.309528082996287e-05, "loss": 0.5932351589202881, "mean_token_accuracy": 0.8430131062865257, "num_tokens": 22878451.0, "step": 4280 }, { "entropy": 0.5524549225345254, "epoch": 0.7432512912691795, "grad_norm": 0.27734375, "learning_rate": 3.267924221546707e-05, "loss": 0.5674274444580079, "mean_token_accuracy": 0.8445836905390024, "num_tokens": 22926711.0, "step": 4290 }, { "entropy": 0.5855007180478424, "epoch": 0.7449838117616485, "grad_norm": 0.248046875, "learning_rate": 3.226532382529819e-05, "loss": 0.5742456436157226, "mean_token_accuracy": 0.8387997157871723, "num_tokens": 22978219.0, "step": 4300 }, { "entropy": 0.5859048544429243, "epoch": 0.7467163322541175, "grad_norm": 0.263671875, "learning_rate": 3.185353869555197e-05, "loss": 0.6278098106384278, "mean_token_accuracy": 0.8396085597574711, "num_tokens": 23032320.0, "step": 4310 }, { "entropy": 0.5829876080388203, "epoch": 0.7484488527465863, "grad_norm": 0.240234375, "learning_rate": 3.1443899795138453e-05, "loss": 0.5955277919769287, "mean_token_accuracy": 0.8417782884091138, "num_tokens": 23085064.0, "step": 4320 }, { "entropy": 0.578710913611576, "epoch": 0.7501813732390553, "grad_norm": 0.1806640625, "learning_rate": 3.103642002537349e-05, "loss": 0.5915605545043945, "mean_token_accuracy": 0.8424369305372238, "num_tokens": 23136211.0, "step": 4330 }, { "entropy": 0.5652547443984076, "epoch": 0.7519138937315243, "grad_norm": 0.201171875, "learning_rate": 3.06311122195725e-05, "loss": 0.5689744472503662, "mean_token_accuracy": 0.8439708940684796, "num_tokens": 23193103.0, "step": 4340 }, { "entropy": 0.5435447356197983, "epoch": 0.7536464142239933, "grad_norm": 0.1630859375, "learning_rate": 3.0227989142646328e-05, "loss": 0.5281671524047852, "mean_token_accuracy": 0.8518698431551457, "num_tokens": 23247160.0, "step": 4350 }, { "entropy": 0.5385241145500913, "epoch": 0.7553789347164622, "grad_norm": 0.19140625, "learning_rate": 2.9827063490699224e-05, "loss": 0.5298691749572754, "mean_token_accuracy": 0.8524676557630301, "num_tokens": 23297655.0, "step": 4360 }, { "entropy": 0.5880491819232703, "epoch": 0.7571114552089312, "grad_norm": 0.2216796875, "learning_rate": 2.942834789062876e-05, "loss": 0.6208145141601562, "mean_token_accuracy": 0.8424996003508568, "num_tokens": 23348699.0, "step": 4370 }, { "entropy": 0.5774009396787733, "epoch": 0.7588439757014, "grad_norm": 0.1875, "learning_rate": 2.9031854899728483e-05, "loss": 0.5922607421875, "mean_token_accuracy": 0.8419295348227024, "num_tokens": 23402802.0, "step": 4380 }, { "entropy": 0.5759732277598232, "epoch": 0.760576496193869, "grad_norm": 0.1962890625, "learning_rate": 2.8637597005292293e-05, "loss": 0.5788041114807129, "mean_token_accuracy": 0.8396513409912586, "num_tokens": 23456158.0, "step": 4390 }, { "entropy": 0.5810914925299585, "epoch": 0.762309016686338, "grad_norm": 0.283203125, "learning_rate": 2.8245586624221077e-05, "loss": 0.5863104343414307, "mean_token_accuracy": 0.8429031614214182, "num_tokens": 23509433.0, "step": 4400 }, { "entropy": 0.5689767023082822, "epoch": 0.764041537178807, "grad_norm": 0.275390625, "learning_rate": 2.7855836102631706e-05, "loss": 0.5630904197692871, "mean_token_accuracy": 0.8441053662449122, "num_tokens": 23562016.0, "step": 4410 }, { "entropy": 0.614728789892979, "epoch": 0.7657740576712759, "grad_norm": 0.251953125, "learning_rate": 2.7468357715468295e-05, "loss": 0.6392505168914795, "mean_token_accuracy": 0.8323461454361677, "num_tokens": 23617492.0, "step": 4420 }, { "entropy": 0.5409275959711521, "epoch": 0.7675065781637448, "grad_norm": 0.1962890625, "learning_rate": 2.7083163666115564e-05, "loss": 0.5301029682159424, "mean_token_accuracy": 0.850815711542964, "num_tokens": 23670181.0, "step": 4430 }, { "entropy": 0.5779091130942107, "epoch": 0.7692390986562138, "grad_norm": 0.291015625, "learning_rate": 2.670026608601429e-05, "loss": 0.5737006187438964, "mean_token_accuracy": 0.8406471200287342, "num_tokens": 23715480.0, "step": 4440 }, { "entropy": 0.5803326781373471, "epoch": 0.7709716191486827, "grad_norm": 0.2314453125, "learning_rate": 2.6319677034279588e-05, "loss": 0.594749927520752, "mean_token_accuracy": 0.8403228733688592, "num_tokens": 23771140.0, "step": 4450 }, { "entropy": 0.5970675764605403, "epoch": 0.7727041396411517, "grad_norm": 0.1962890625, "learning_rate": 2.5941408497320918e-05, "loss": 0.584465217590332, "mean_token_accuracy": 0.8358738787472249, "num_tokens": 23821701.0, "step": 4460 }, { "entropy": 0.5566497812396847, "epoch": 0.7744366601336207, "grad_norm": 0.171875, "learning_rate": 2.556547238846456e-05, "loss": 0.5480396747589111, "mean_token_accuracy": 0.8482368070632219, "num_tokens": 23877867.0, "step": 4470 }, { "entropy": 0.6114168071071617, "epoch": 0.7761691806260896, "grad_norm": 0.1826171875, "learning_rate": 2.519188054757844e-05, "loss": 0.6127332210540771, "mean_token_accuracy": 0.8352025974541902, "num_tokens": 23929405.0, "step": 4480 }, { "entropy": 0.5839661170262843, "epoch": 0.7779017011185585, "grad_norm": 0.255859375, "learning_rate": 2.482064474069933e-05, "loss": 0.6061002254486084, "mean_token_accuracy": 0.8387925371527671, "num_tokens": 23986820.0, "step": 4490 }, { "entropy": 0.5634350700303912, "epoch": 0.7796342216110275, "grad_norm": 0.24609375, "learning_rate": 2.4451776659662208e-05, "loss": 0.5573660850524902, "mean_token_accuracy": 0.8468219470232725, "num_tokens": 24042717.0, "step": 4500 }, { "entropy": 0.6055240669287741, "epoch": 0.7813667421034964, "grad_norm": 0.2080078125, "learning_rate": 2.408528792173197e-05, "loss": 0.6256453514099121, "mean_token_accuracy": 0.8374260023236275, "num_tokens": 24091266.0, "step": 4510 }, { "entropy": 0.5546964854118415, "epoch": 0.7830992625959654, "grad_norm": 0.21875, "learning_rate": 2.3721190069237654e-05, "loss": 0.5397284984588623, "mean_token_accuracy": 0.8491404488682747, "num_tokens": 24151273.0, "step": 4520 }, { "entropy": 0.5505000121425837, "epoch": 0.7848317830884344, "grad_norm": 0.20703125, "learning_rate": 2.3359494569208928e-05, "loss": 0.5483803272247314, "mean_token_accuracy": 0.8495641268789769, "num_tokens": 24206696.0, "step": 4530 }, { "entropy": 0.5746214020065963, "epoch": 0.7865643035809033, "grad_norm": 0.263671875, "learning_rate": 2.3000212813014833e-05, "loss": 0.5868116855621338, "mean_token_accuracy": 0.8428641192615032, "num_tokens": 24259880.0, "step": 4540 }, { "entropy": 0.5514689449686557, "epoch": 0.7882968240733722, "grad_norm": 0.20703125, "learning_rate": 2.264335611600511e-05, "loss": 0.5632360458374024, "mean_token_accuracy": 0.8478600643575191, "num_tokens": 24311579.0, "step": 4550 }, { "entropy": 0.5926326899789274, "epoch": 0.7900293445658412, "grad_norm": 0.2265625, "learning_rate": 2.2288935717153826e-05, "loss": 0.5733819484710694, "mean_token_accuracy": 0.8435305185616017, "num_tokens": 24363728.0, "step": 4560 }, { "entropy": 0.5693248523864896, "epoch": 0.7917618650583101, "grad_norm": 0.263671875, "learning_rate": 2.1936962778705418e-05, "loss": 0.5535439491271973, "mean_token_accuracy": 0.8427335467189551, "num_tokens": 24417545.0, "step": 4570 }, { "entropy": 0.5928860791958869, "epoch": 0.7934943855507791, "grad_norm": 0.2080078125, "learning_rate": 2.158744838582305e-05, "loss": 0.6109635829925537, "mean_token_accuracy": 0.8377186991274357, "num_tokens": 24469529.0, "step": 4580 }, { "entropy": 0.5517147674690932, "epoch": 0.7952269060432481, "grad_norm": 0.19140625, "learning_rate": 2.1240403546239573e-05, "loss": 0.55843505859375, "mean_token_accuracy": 0.8467742208391428, "num_tokens": 24526586.0, "step": 4590 }, { "entropy": 0.5572149983141571, "epoch": 0.7969594265357169, "grad_norm": 0.201171875, "learning_rate": 2.0895839189910903e-05, "loss": 0.5667229175567627, "mean_token_accuracy": 0.8488913148641586, "num_tokens": 24583652.0, "step": 4600 }, { "entropy": 0.5736112500540912, "epoch": 0.7986919470281859, "grad_norm": 0.2099609375, "learning_rate": 2.055376616867164e-05, "loss": 0.5669754028320313, "mean_token_accuracy": 0.8435257486999035, "num_tokens": 24642176.0, "step": 4610 }, { "entropy": 0.579422784037888, "epoch": 0.8004244675206549, "grad_norm": 0.2392578125, "learning_rate": 2.0214195255893363e-05, "loss": 0.5869145870208741, "mean_token_accuracy": 0.8378935415297747, "num_tokens": 24699945.0, "step": 4620 }, { "entropy": 0.6002859427593649, "epoch": 0.8021569880131239, "grad_norm": 0.203125, "learning_rate": 1.987713714614543e-05, "loss": 0.6259641647338867, "mean_token_accuracy": 0.8333838868886232, "num_tokens": 24755005.0, "step": 4630 }, { "entropy": 0.5577911037951708, "epoch": 0.8038895085055928, "grad_norm": 0.1728515625, "learning_rate": 1.9542602454858038e-05, "loss": 0.5876730442047119, "mean_token_accuracy": 0.8446177303791046, "num_tokens": 24807589.0, "step": 4640 }, { "entropy": 0.5511742249131203, "epoch": 0.8056220289980618, "grad_norm": 0.2119140625, "learning_rate": 1.9210601717987886e-05, "loss": 0.5123077392578125, "mean_token_accuracy": 0.8508127823472023, "num_tokens": 24862286.0, "step": 4650 }, { "entropy": 0.5655517499893904, "epoch": 0.8073545494905306, "grad_norm": 0.236328125, "learning_rate": 1.8881145391686383e-05, "loss": 0.5731409549713135, "mean_token_accuracy": 0.8426301058381795, "num_tokens": 24919245.0, "step": 4660 }, { "entropy": 0.5823489186353982, "epoch": 0.8090870699829996, "grad_norm": 0.1611328125, "learning_rate": 1.8554243851970465e-05, "loss": 0.5956488132476807, "mean_token_accuracy": 0.8402592360973358, "num_tokens": 24972322.0, "step": 4670 }, { "entropy": 0.615665140748024, "epoch": 0.8108195904754686, "grad_norm": 0.244140625, "learning_rate": 1.822990739439556e-05, "loss": 0.6114068984985351, "mean_token_accuracy": 0.8344416070729495, "num_tokens": 25026301.0, "step": 4680 }, { "entropy": 0.5908701654989272, "epoch": 0.8125521109679376, "grad_norm": 0.1943359375, "learning_rate": 1.7908146233731516e-05, "loss": 0.5971941947937012, "mean_token_accuracy": 0.8422229964286089, "num_tokens": 25082425.0, "step": 4690 }, { "entropy": 0.6170886626467109, "epoch": 0.8142846314604065, "grad_norm": 0.255859375, "learning_rate": 1.758897050364089e-05, "loss": 0.6370350360870362, "mean_token_accuracy": 0.8319076154381037, "num_tokens": 25141282.0, "step": 4700 }, { "entropy": 0.5807770256418735, "epoch": 0.8160171519528755, "grad_norm": 0.236328125, "learning_rate": 1.7272390256359726e-05, "loss": 0.5834021091461181, "mean_token_accuracy": 0.8393303919583559, "num_tokens": 25192984.0, "step": 4710 }, { "entropy": 0.5795641975477338, "epoch": 0.8177496724453444, "grad_norm": 0.2001953125, "learning_rate": 1.6958415462380982e-05, "loss": 0.5941871166229248, "mean_token_accuracy": 0.842550129443407, "num_tokens": 25247078.0, "step": 4720 }, { "entropy": 0.5757013593101874, "epoch": 0.8194821929378133, "grad_norm": 0.2158203125, "learning_rate": 1.6647056010140494e-05, "loss": 0.6085315227508545, "mean_token_accuracy": 0.8438326179981231, "num_tokens": 25297441.0, "step": 4730 }, { "entropy": 0.5631363501306623, "epoch": 0.8212147134302823, "grad_norm": 0.181640625, "learning_rate": 1.633832170570565e-05, "loss": 0.5446923255920411, "mean_token_accuracy": 0.8464885164052248, "num_tokens": 25351087.0, "step": 4740 }, { "entropy": 0.5960177618311718, "epoch": 0.8229472339227513, "grad_norm": 0.18359375, "learning_rate": 1.6032222272466456e-05, "loss": 0.6015133857727051, "mean_token_accuracy": 0.8357700191438198, "num_tokens": 25406833.0, "step": 4750 }, { "entropy": 0.5622742976062, "epoch": 0.8246797544152202, "grad_norm": 0.267578125, "learning_rate": 1.572876735082931e-05, "loss": 0.5792129039764404, "mean_token_accuracy": 0.8478969302028417, "num_tokens": 25462922.0, "step": 4760 }, { "entropy": 0.5860844446811825, "epoch": 0.8264122749076891, "grad_norm": 0.1396484375, "learning_rate": 1.5427966497913382e-05, "loss": 0.5700845718383789, "mean_token_accuracy": 0.8390550728887319, "num_tokens": 25519835.0, "step": 4770 }, { "entropy": 0.5723399114562199, "epoch": 0.8281447954001581, "grad_norm": 0.205078125, "learning_rate": 1.5129829187249733e-05, "loss": 0.5587327480316162, "mean_token_accuracy": 0.8436962455511093, "num_tokens": 25572862.0, "step": 4780 }, { "entropy": 0.6173130693845451, "epoch": 0.829877315892627, "grad_norm": 0.24609375, "learning_rate": 1.483436480848276e-05, "loss": 0.6014991283416748, "mean_token_accuracy": 0.8375725369900465, "num_tokens": 25619756.0, "step": 4790 }, { "entropy": 0.5997563745826483, "epoch": 0.831609836385096, "grad_norm": 0.2158203125, "learning_rate": 1.4541582667074605e-05, "loss": 0.6501627922058105, "mean_token_accuracy": 0.8382502742111683, "num_tokens": 25672657.0, "step": 4800 }, { "entropy": 0.6088074346072971, "epoch": 0.833342356877565, "grad_norm": 0.2333984375, "learning_rate": 1.425149198401209e-05, "loss": 0.6090521335601806, "mean_token_accuracy": 0.8370539605617523, "num_tokens": 25726543.0, "step": 4810 }, { "entropy": 0.5758180576376617, "epoch": 0.8350748773700339, "grad_norm": 0.1787109375, "learning_rate": 1.3964101895516258e-05, "loss": 0.5777298927307128, "mean_token_accuracy": 0.8420398116111756, "num_tokens": 25780444.0, "step": 4820 }, { "entropy": 0.5725994257256388, "epoch": 0.8368073978625028, "grad_norm": 0.173828125, "learning_rate": 1.3679421452754627e-05, "loss": 0.6158907890319825, "mean_token_accuracy": 0.8438146792352199, "num_tokens": 25833018.0, "step": 4830 }, { "entropy": 0.5271360840764828, "epoch": 0.8385399183549718, "grad_norm": 0.1796875, "learning_rate": 1.339745962155613e-05, "loss": 0.4843564033508301, "mean_token_accuracy": 0.8528855789452792, "num_tokens": 25885932.0, "step": 4840 }, { "entropy": 0.5767460000701249, "epoch": 0.8402724388474407, "grad_norm": 0.1669921875, "learning_rate": 1.311822528212886e-05, "loss": 0.5902610778808594, "mean_token_accuracy": 0.8412225931882858, "num_tokens": 25935679.0, "step": 4850 }, { "entropy": 0.5638484083116054, "epoch": 0.8420049593399097, "grad_norm": 0.208984375, "learning_rate": 1.2841727228780187e-05, "loss": 0.5590053081512452, "mean_token_accuracy": 0.8466204077005386, "num_tokens": 25990464.0, "step": 4860 }, { "entropy": 0.5571088962838985, "epoch": 0.8437374798323787, "grad_norm": 0.2119140625, "learning_rate": 1.256797416963994e-05, "loss": 0.5606691360473632, "mean_token_accuracy": 0.8445250861346721, "num_tokens": 26047087.0, "step": 4870 }, { "entropy": 0.5812531022820622, "epoch": 0.8454700003248475, "grad_norm": 0.23046875, "learning_rate": 1.2296974726386123e-05, "loss": 0.595766830444336, "mean_token_accuracy": 0.8446589518338442, "num_tokens": 26098529.0, "step": 4880 }, { "entropy": 0.5640038163866847, "epoch": 0.8472025208173165, "grad_norm": 0.177734375, "learning_rate": 1.2028737433973358e-05, "loss": 0.5880807399749756, "mean_token_accuracy": 0.8454778704792261, "num_tokens": 26152935.0, "step": 4890 }, { "entropy": 0.5730855024885386, "epoch": 0.8489350413097855, "grad_norm": 0.2041015625, "learning_rate": 1.1763270740364073e-05, "loss": 0.5882959842681885, "mean_token_accuracy": 0.8418738380074501, "num_tokens": 26207299.0, "step": 4900 }, { "entropy": 0.563043595594354, "epoch": 0.8506675618022544, "grad_norm": 0.296875, "learning_rate": 1.1500583006262423e-05, "loss": 0.587392520904541, "mean_token_accuracy": 0.8417437814176083, "num_tokens": 26259660.0, "step": 4910 }, { "entropy": 0.5787749814800918, "epoch": 0.8524000822947234, "grad_norm": 0.2734375, "learning_rate": 1.1240682504851096e-05, "loss": 0.5740055561065673, "mean_token_accuracy": 0.8416815143078565, "num_tokens": 26316406.0, "step": 4920 }, { "entropy": 0.5916237368946895, "epoch": 0.8541326027871924, "grad_norm": 0.201171875, "learning_rate": 1.0983577421530578e-05, "loss": 0.6176825046539307, "mean_token_accuracy": 0.8374281879514456, "num_tokens": 26371506.0, "step": 4930 }, { "entropy": 0.5775140485726297, "epoch": 0.8558651232796612, "grad_norm": 0.197265625, "learning_rate": 1.0729275853661503e-05, "loss": 0.5840110778808594, "mean_token_accuracy": 0.8430575907230378, "num_tokens": 26430372.0, "step": 4940 }, { "entropy": 0.5944045529700815, "epoch": 0.8575976437721302, "grad_norm": 0.19921875, "learning_rate": 1.0477785810309504e-05, "loss": 0.5982850074768067, "mean_token_accuracy": 0.8358097314834595, "num_tokens": 26483187.0, "step": 4950 }, { "entropy": 0.5662330114166252, "epoch": 0.8593301642645992, "grad_norm": 0.228515625, "learning_rate": 1.0229115211993146e-05, "loss": 0.5489250183105469, "mean_token_accuracy": 0.8467546600848437, "num_tokens": 26531742.0, "step": 4960 }, { "entropy": 0.5814009133726359, "epoch": 0.8610626847570682, "grad_norm": 0.197265625, "learning_rate": 9.983271890434276e-06, "loss": 0.5658225059509278, "mean_token_accuracy": 0.8422036103904247, "num_tokens": 26582463.0, "step": 4970 }, { "entropy": 0.5738571006804705, "epoch": 0.8627952052495371, "grad_norm": 0.1904296875, "learning_rate": 9.740263588311493e-06, "loss": 0.5560882568359375, "mean_token_accuracy": 0.8477094814181327, "num_tokens": 26635409.0, "step": 4980 }, { "entropy": 0.6064791481010616, "epoch": 0.8645277257420061, "grad_norm": 0.208984375, "learning_rate": 9.500097959016296e-06, "loss": 0.5998945236206055, "mean_token_accuracy": 0.8359555754810571, "num_tokens": 26688814.0, "step": 4990 }, { "entropy": 0.6118629967328161, "epoch": 0.866260246234475, "grad_norm": 0.2177734375, "learning_rate": 9.262782566411977e-06, "loss": 0.6543556690216065, "mean_token_accuracy": 0.8329808592796326, "num_tokens": 26739296.0, "step": 5000 } ], "logging_steps": 10, "max_steps": 5772, "num_input_tokens_seen": 0, "num_train_epochs": 1, "save_steps": 200, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 1.1408570883984261e+18, "train_batch_size": 1, "trial_name": null, "trial_params": null }